{"as_of":"2026-08-22T06:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f52da1481e440b62a19610348fabaebc1459c911c806de7a9eb3eef17eb177ae","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T20:43:37.635374Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2603.06642/citation-record","integrity":"/paper/2603.06642/integrity","json":"/paper/2603.06642/citation-record.json","paper":"/paper/2603.06642"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:43:35.881099Z","title":"(2017).Attention Is All You Need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.06642","last_updated":"2026-07-22T21:06:43Z","snapshot_observed_at":"2026-08-16T10:45:58.164948Z","submitted_at":"2026-02-26T01:54:24Z","title":"SR-TTT Does Not Learn Retrieval: A Correction and Mechanistic Post-Mortem of Surprisal-Aware Residual Test-Time Training","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T20:43:35.881099Z"},"links":{"citing_paper":"/paper/2603.06642"},"observation_digest":"sha256:4350c1acab75834ba634e828e68bb148b9595d4f29fcce8e06f6b445b50d1964","observation_id":"75694d6f-4625-4823-8e68-928d4a3e55d6","resolution":{"observed_at":"2026-08-02T20:43:35.881099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:43:35.950613Z","title":"(2020).Test-Time Training with Self-Supervision for Generalization under Distribution Shifts","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.06642","last_updated":"2026-07-22T21:06:43Z","snapshot_observed_at":"2026-08-16T10:45:58.164948Z","submitted_at":"2026-02-26T01:54:24Z","title":"SR-TTT Does Not Learn Retrieval: A Correction and Mechanistic Post-Mortem of Surprisal-Aware Residual Test-Time Training","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T20:43:35.950613Z"},"links":{"citing_paper":"/paper/2603.06642"},"observation_digest":"sha256:b992116da71d810e529e380a6bcb38cfd0218134033155548bd7ca559da5f67f","observation_id":"3422a72c-4495-4ace-94be-257c14891e61","resolution":{"observed_at":"2026-08-02T20:43:35.950613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:43:36.021379Z","title":"(2024).Learning to (Learn at Test Time): RNNs with Expressive Hidden States","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.06642","last_updated":"2026-07-22T21:06:43Z","snapshot_observed_at":"2026-08-16T10:45:58.164948Z","submitted_at":"2026-02-26T01:54:24Z","title":"SR-TTT Does Not Learn Retrieval: A Correction and Mechanistic Post-Mortem of Surprisal-Aware Residual Test-Time Training","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T20:43:36.021379Z"},"links":{"citing_paper":"/paper/2603.06642"},"observation_digest":"sha256:04392b6a5335c817e28bbb4202ddfff8fcfd772aafe7b05aeb486de946079b32","observation_id":"d1bbf254-a46d-4612-8e47-76ae9f9f50aa","resolution":{"observed_at":"2026-08-02T20:43:36.021379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23884","last_updated":"2025-05-29T17:50:34Z","snapshot_observed_at":"2026-08-08T17:47:51.120243Z","submitted_at":"2025-05-29T17:50:34Z","title":"Test-Time Training Done Right","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23884","snapshot_observed_at":"2026-08-02T20:43:36.082526Z","title":"(2025).Test-Time Training Done Right","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06642","last_updated":"2026-07-22T21:06:43Z","snapshot_observed_at":"2026-08-16T10:45:58.164948Z","submitted_at":"2026-02-26T01:54:24Z","title":"SR-TTT Does Not Learn Retrieval: A Correction and Mechanistic Post-Mortem of Surprisal-Aware Residual Test-Time Training","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T20:43:36.082526Z"},"links":{"cited_paper":"/paper/2505.23884","citing_paper":"/paper/2603.06642"},"observation_digest":"sha256:3bcd9b7f2865541ee9a515402b6f6caf9a0d27332b58d39eba5f595245a38a6f","observation_id":"6dec8a8c-1dde-48dc-8d60-410414e3e872","resolution":{"observed_at":"2026-08-02T20:43:36.082526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:43:36.191586Z","title":"(2026).Gated Differentiable Working Memory (GDWM) for Long-Context Language Modeling","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.06642","last_updated":"2026-07-22T21:06:43Z","snapshot_observed_at":"2026-08-16T10:45:58.164948Z","submitted_at":"2026-02-26T01:54:24Z","title":"SR-TTT Does Not Learn Retrieval: A Correction and Mechanistic Post-Mortem of Surprisal-Aware Residual Test-Time Training","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T20:43:36.191586Z"},"links":{"citing_paper":"/paper/2603.06642"},"observation_digest":"sha256:180704bafd7cf6eaa45e8feea19b95f58cfd615701d58bbdd829c33d3ac28519","observation_id":"3deafdcc-16e1-403b-83bb-0c50dcd08f2f","resolution":{"observed_at":"2026-08-02T20:43:36.191586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:43:36.359871Z","title":"F., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.06642","last_updated":"2026-07-22T21:06:43Z","snapshot_observed_at":"2026-08-16T10:45:58.164948Z","submitted_at":"2026-02-26T01:54:24Z","title":"SR-TTT Does Not Learn Retrieval: A Correction and Mechanistic Post-Mortem of Surprisal-Aware Residual Test-Time Training","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T20:43:36.359871Z"},"links":{"citing_paper":"/paper/2603.06642"},"observation_digest":"sha256:0c6d6bf91d17ff0adafaf318ae93a36a458575bb26e9fe4eca2e5e3e9e11923d","observation_id":"fbd984b9-f0c5-4bd9-8884-6e27320563b0","resolution":{"observed_at":"2026-08-02T20:43:36.359871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:43:36.426811Z","title":"(2023).Needle In A Haystack – Pressure Testing LLMs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.06642","last_updated":"2026-07-22T21:06:43Z","snapshot_observed_at":"2026-08-16T10:45:58.164948Z","submitted_at":"2026-02-26T01:54:24Z","title":"SR-TTT Does Not Learn Retrieval: A Correction and Mechanistic Post-Mortem of Surprisal-Aware Residual Test-Time Training","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T20:43:36.426811Z"},"links":{"citing_paper":"/paper/2603.06642"},"observation_digest":"sha256:f6cf862a164055560ac7c4a7396063ee8d7223281f69957f1552628fbaf4ec73","observation_id":"8036a418-5918-4475-b936-76afb824ee1a","resolution":{"observed_at":"2026-08-02T20:43:36.426811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-08-17T20:47:46.242385Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-02T20:43:36.501176Z","title":"(2023).Mamba: Linear-Time Sequence Modeling with Selective State Spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.06642","last_updated":"2026-07-22T21:06:43Z","snapshot_observed_at":"2026-08-16T10:45:58.164948Z","submitted_at":"2026-02-26T01:54:24Z","title":"SR-TTT Does Not Learn Retrieval: A Correction and Mechanistic Post-Mortem of Surprisal-Aware Residual Test-Time Training","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T20:43:36.501176Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2603.06642"},"observation_digest":"sha256:7ad0de8cad739483812c1fa69460cb3f93aca632f197026d893b0f57d82b626c","observation_id":"cb23690b-88a9-4288-a9e0-c74fb80aa210","resolution":{"observed_at":"2026-08-02T20:43:36.501176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:43:36.612867Z","title":"(2023).RWKV: Reinventing RNNs for the Transformer Era","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.06642","last_updated":"2026-07-22T21:06:43Z","snapshot_observed_at":"2026-08-16T10:45:58.164948Z","submitted_at":"2026-02-26T01:54:24Z","title":"SR-TTT Does Not Learn Retrieval: A Correction and Mechanistic Post-Mortem of Surprisal-Aware Residual Test-Time Training","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T20:43:36.612867Z"},"links":{"citing_paper":"/paper/2603.06642"},"observation_digest":"sha256:028d3b7194534e8b289aabc1f075e73e56a3d6bede99a71ea2f5f3829cf74f2b","observation_id":"c9b257b6-f772-4e0b-acf5-27871be06db9","resolution":{"observed_at":"2026-08-02T20:43:36.612867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00663","last_updated":"2024-12-31T22:32:03Z","snapshot_observed_at":"2026-08-16T10:45:05.594811Z","submitted_at":"2024-12-31T22:32:03Z","title":"Titans: Learning to Memorize at Test Time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00663","snapshot_observed_at":"2026-08-02T20:43:36.742463Z","title":"(2025).Titans: Learning to Memorize at Test Time","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06642","last_updated":"2026-07-22T21:06:43Z","snapshot_observed_at":"2026-08-16T10:45:58.164948Z","submitted_at":"2026-02-26T01:54:24Z","title":"SR-TTT Does Not Learn Retrieval: A Correction and Mechanistic Post-Mortem of Surprisal-Aware Residual Test-Time Training","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T20:43:36.742463Z"},"links":{"cited_paper":"/paper/2501.00663","citing_paper":"/paper/2603.06642"},"observation_digest":"sha256:48b6a9ea2bfd20a77a962d46f54c40bbcb9b9e901be79fc581d3f22ef3c3856b","observation_id":"0989ade6-e56f-49bd-a9cd-9f117b0b9eff","resolution":{"observed_at":"2026-08-02T20:43:36.742463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:43:36.817413Z","title":"(2024).Simple Linear Attention Language Models Balance the Recall-Throughput Tradeoff","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.06642","last_updated":"2026-07-22T21:06:43Z","snapshot_observed_at":"2026-08-16T10:45:58.164948Z","submitted_at":"2026-02-26T01:54:24Z","title":"SR-TTT Does Not Learn Retrieval: A Correction and Mechanistic Post-Mortem of Surprisal-Aware Residual Test-Time Training","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T20:43:36.817413Z"},"links":{"citing_paper":"/paper/2603.06642"},"observation_digest":"sha256:f85d1b5290401ce744f6662d6f41b42d073b1395c55ce77a02899c1d3e517292","observation_id":"f3edf507-b039-4c99-a4c5-eab6352b839c","resolution":{"observed_at":"2026-08-02T20:43:36.817413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:43:36.868262Z","title":"(2024).Zoology: Measuring and Improving Recall in Efficient Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.06642","last_updated":"2026-07-22T21:06:43Z","snapshot_observed_at":"2026-08-16T10:45:58.164948Z","submitted_at":"2026-02-26T01:54:24Z","title":"SR-TTT Does Not Learn Retrieval: A Correction and Mechanistic Post-Mortem of Surprisal-Aware Residual Test-Time Training","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T20:43:36.868262Z"},"links":{"citing_paper":"/paper/2603.06642"},"observation_digest":"sha256:a4e2ab37906eed2743f9babe6406ae9515d0630819d29fd6ac1a8123a65a115d","observation_id":"9e0559d0-6000-4a9c-ad3e-677e2188302a","resolution":{"observed_at":"2026-08-02T20:43:36.868262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:43:36.942675Z","title":"(2024).Get More with LESS: Synthesizing Recurrence with KV Cache Compression for Efficient LLM Inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.06642","last_updated":"2026-07-22T21:06:43Z","snapshot_observed_at":"2026-08-16T10:45:58.164948Z","submitted_at":"2026-02-26T01:54:24Z","title":"SR-TTT Does Not Learn Retrieval: A Correction and Mechanistic Post-Mortem of Surprisal-Aware Residual Test-Time Training","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T20:43:36.942675Z"},"links":{"citing_paper":"/paper/2603.06642"},"observation_digest":"sha256:0642be12d122cfd52bb8cbab580609b196e0ffc0368950f0f095a6d317a0d57e","observation_id":"8dcd8aa9-e883-4b6c-adb1-558b0d38a0c6","resolution":{"observed_at":"2026-08-02T20:43:36.942675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:43:37.044877Z","title":"(2025).Cache What Lasts: Token Retention for Memory-Bounded KV Cache in LLMs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06642","last_updated":"2026-07-22T21:06:43Z","snapshot_observed_at":"2026-08-16T10:45:58.164948Z","submitted_at":"2026-02-26T01:54:24Z","title":"SR-TTT Does Not Learn Retrieval: A Correction and Mechanistic Post-Mortem of Surprisal-Aware Residual Test-Time Training","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T20:43:37.044877Z"},"links":{"citing_paper":"/paper/2603.06642"},"observation_digest":"sha256:8d7a9c79dad0b58c3d754e25f3742cb5a9ec590a014cacb83e07224102302eaa","observation_id":"0186dea8-15c6-4ffc-aefd-e06921973236","resolution":{"observed_at":"2026-08-02T20:43:37.044877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:43:37.166781Z","title":"(2024).MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.06642","last_updated":"2026-07-22T21:06:43Z","snapshot_observed_at":"2026-08-16T10:45:58.164948Z","submitted_at":"2026-02-26T01:54:24Z","title":"SR-TTT Does Not Learn Retrieval: A Correction and Mechanistic Post-Mortem of Surprisal-Aware Residual Test-Time Training","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T20:43:37.166781Z"},"links":{"citing_paper":"/paper/2603.06642"},"observation_digest":"sha256:3fbbd003e87f46cd2e774715da1c6d549aada544c63b3cb2e5246e0253b46577","observation_id":"c6d67a6f-192d-4ea5-b37f-4d977bb567e5","resolution":{"observed_at":"2026-08-02T20:43:37.166781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-02T20:43:37.256381Z","title":"(2024).KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantiza- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.06642","last_updated":"2026-07-22T21:06:43Z","snapshot_observed_at":"2026-08-16T10:45:58.164948Z","submitted_at":"2026-02-26T01:54:24Z","title":"SR-TTT Does Not Learn Retrieval: A Correction and Mechanistic Post-Mortem of Surprisal-Aware Residual Test-Time Training","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T20:43:37.256381Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2603.06642"},"observation_digest":"sha256:eb2522a817bff2774e383e2bc9ec0dacad1f2181f1e9ef0c1238adb82b62221b","observation_id":"d8e2c0b5-458f-4baf-b766-d3d418fc5841","resolution":{"observed_at":"2026-08-02T20:43:37.256381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:43:37.378095Z","title":"(2024).H 2O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.06642","last_updated":"2026-07-22T21:06:43Z","snapshot_observed_at":"2026-08-16T10:45:58.164948Z","submitted_at":"2026-02-26T01:54:24Z","title":"SR-TTT Does Not Learn Retrieval: A Correction and Mechanistic Post-Mortem of Surprisal-Aware Residual Test-Time Training","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T20:43:37.378095Z"},"links":{"citing_paper":"/paper/2603.06642"},"observation_digest":"sha256:313faa307a9bbe1b1fbe3940f99c151b2fea23038b21c331cd6e66a32bad2cb9","observation_id":"27751f3e-0844-40e9-8b11-95a7306c453b","resolution":{"observed_at":"2026-08-02T20:43:37.378095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:43:37.467237Z","title":"(2024).Dynamic Memory Compression: Retrofitting LLMs for Accelerated Inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.06642","last_updated":"2026-07-22T21:06:43Z","snapshot_observed_at":"2026-08-16T10:45:58.164948Z","submitted_at":"2026-02-26T01:54:24Z","title":"SR-TTT Does Not Learn Retrieval: A Correction and Mechanistic Post-Mortem of Surprisal-Aware Residual Test-Time Training","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T20:43:37.467237Z"},"links":{"citing_paper":"/paper/2603.06642"},"observation_digest":"sha256:9f7e573b8ebe796e1aa33f402148eb4afa8a544af51918ea4982a5649eef7509","observation_id":"fb62226e-15c4-4ea8-8d94-79f5bc76a46e","resolution":{"observed_at":"2026-08-02T20:43:37.467237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07759","last_updated":"2023-05-24T23:30:43Z","snapshot_observed_at":"2026-08-20T14:47:29.320021Z","submitted_at":"2023-05-12T20:56:48Z","title":"TinyStories: How Small Can Language Models Be and Still Speak Coherent English?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07759","snapshot_observed_at":"2026-08-02T20:43:37.517425Z","title":"(2023).TinyStories: How Small Can Language Models Be and Still Speak Coherent English?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.06642","last_updated":"2026-07-22T21:06:43Z","snapshot_observed_at":"2026-08-16T10:45:58.164948Z","submitted_at":"2026-02-26T01:54:24Z","title":"SR-TTT Does Not Learn Retrieval: A Correction and Mechanistic Post-Mortem of Surprisal-Aware Residual Test-Time Training","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T20:43:37.517425Z"},"links":{"cited_paper":"/paper/2305.07759","citing_paper":"/paper/2603.06642"},"observation_digest":"sha256:e012db1d533d7a66472a397ab0780644ec4e4af8274e6e1d33da8325a37ea835","observation_id":"bb4bc3da-3819-4872-af09-d018dbcf2a08","resolution":{"observed_at":"2026-08-02T20:43:37.517425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-08-17T06:56:20.644738Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-02T20:43:37.565942Z","title":"(2021).RoFormer: Enhanced Transformer with Rotary Position Embedding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.06642","last_updated":"2026-07-22T21:06:43Z","snapshot_observed_at":"2026-08-16T10:45:58.164948Z","submitted_at":"2026-02-26T01:54:24Z","title":"SR-TTT Does Not Learn Retrieval: A Correction and Mechanistic Post-Mortem of Surprisal-Aware Residual Test-Time Training","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T20:43:37.565942Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2603.06642"},"observation_digest":"sha256:9372b166ba90d5c35f6b88cd87f92d3ba9b36b1f08fcacb5a70edec834f8cbf1","observation_id":"57b77d9f-222a-421a-8a8a-f7d04c599a57","resolution":{"observed_at":"2026-08-02T20:43:37.565942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00071","last_updated":"2026-02-06T19:40:50Z","snapshot_observed_at":"2026-08-18T09:44:25.224559Z","submitted_at":"2023-08-31T18:18:07Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00071","snapshot_observed_at":"2026-08-02T20:43:37.635374Z","title":"(2023).YaRN: Efficient Context Window Extension of Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.06642","last_updated":"2026-07-22T21:06:43Z","snapshot_observed_at":"2026-08-16T10:45:58.164948Z","submitted_at":"2026-02-26T01:54:24Z","title":"SR-TTT Does Not Learn Retrieval: A Correction and Mechanistic Post-Mortem of Surprisal-Aware Residual Test-Time Training","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T20:43:37.635374Z"},"links":{"cited_paper":"/paper/2309.00071","citing_paper":"/paper/2603.06642"},"observation_digest":"sha256:550d043d2c0580fbd4a8c1bbec361d82be9f5fcdb3e658eaac5a75290fd56824","observation_id":"ee5d69d5-004b-496d-9762-d59351477fe4","resolution":{"observed_at":"2026-08-02T20:43:37.635374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.06642","last_updated":"2026-07-22T21:06:43Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T10:45:58.164948Z","submitted_at":"2026-02-26T01:54:24Z","title":"SR-TTT Does Not Learn Retrieval: A Correction and Mechanistic Post-Mortem of Surprisal-Aware Residual Test-Time Training"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2603.06642."}