{"as_of":"2026-08-09T02:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b3a9bc28a93a7e8148e107e55b194cd0ef0a95a82e1fcaece23a3ea0abf2b53f","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T23:14:12.487890Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01672/citation-record","integrity":"/paper/2608.01672/integrity","json":"/paper/2608.01672/citation-record.json","paper":"/paper/2608.01672"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.02737","last_updated":"2025-02-04T21:43:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-04T21:43:16Z","title":"SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02737","snapshot_observed_at":"2026-08-04T23:14:04.620717Z","title":"Smollm2: When smol goes big–data-centric training of a small language model.arXiv preprint arXiv:2502.02737, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:04.620717Z"},"links":{"cited_paper":"/paper/2502.02737","citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:621153402d0aa4a2b32bbbe6d901d631bc6297c35aafb7430567162d75617c00","observation_id":"25ca538f-d972-44a1-beb3-6a536ead5d5b","resolution":{"observed_at":"2026-08-04T23:14:04.620717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:14:04.756074Z","title":"Using fast weights to attend to the recent past.Advances in neural information processing systems, 29, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:04.756074Z"},"links":{"citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:083ad6135d558e95afb0ac0b48bc4d2cb27063415093d582921f9b94f0fe7edf","observation_id":"6034f659-c302-4f72-9d5c-6be2765af8ab","resolution":{"observed_at":"2026-08-04T23:14:04.756074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.01271","last_updated":"2018-04-19T14:32:38Z","snapshot_observed_at":"2026-07-06T06:26:27.965096Z","submitted_at":"2018-03-04T00:20:29Z","title":"An Empirical Evaluation of Generic Convolutional and Recurrent Networks for Sequence Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.01271","snapshot_observed_at":"2026-08-04T23:14:04.918437Z","title":"An empirical evaluation of generic convolutional and recurrent networks for sequence modeling.arXiv preprint arXiv:1803.01271, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:04.918437Z"},"links":{"cited_paper":"/paper/1803.01271","citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:7c7a33ef14cb411883fa2769f30bb7271ab1389dee95d9918d81e523b1b78595","observation_id":"4a8c3380-a083-4314-8a25-23d679cf89af","resolution":{"observed_at":"2026-08-04T23:14:04.918437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00663","last_updated":"2024-12-31T22:32:03Z","snapshot_observed_at":"2026-08-07T09:00:33.558814Z","submitted_at":"2024-12-31T22:32:03Z","title":"Titans: Learning to Memorize at Test Time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00663","snapshot_observed_at":"2026-08-04T23:14:05.016701Z","title":"Titans: Learning to memorize at test time","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:05.016701Z"},"links":{"cited_paper":"/paper/2501.00663","citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:89a2a58a94d9fc841721126c26831434ecd4e8adcb0922449a1c4fdba9e0a3b9","observation_id":"7fb360cc-2a80-4f60-a6ad-6f8c3679c091","resolution":{"observed_at":"2026-08-04T23:14:05.016701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14782","last_updated":"2026-05-31T00:04:33Z","snapshot_observed_at":"2026-08-07T18:21:12.072228Z","submitted_at":"2024-05-23T16:50:49Z","title":"Lessons from the Trenches on Reproducible Evaluation of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14782","snapshot_observed_at":"2026-08-04T23:14:05.158429Z","title":"Lessons from the trenches on reproducible evaluation of language models.arXiv preprint arXiv:2405.14782, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:05.158429Z"},"links":{"cited_paper":"/paper/2405.14782","citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:871dae7ae157e6eda595417e95285a4feaf52d404eabb962e4c35396031156f8","observation_id":"c15e55c8-6b23-48cf-96b8-62549536d869","resolution":{"observed_at":"2026-08-04T23:14:05.158429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10337","last_updated":"2025-03-13T13:15:28Z","snapshot_observed_at":"2026-08-07T17:07:11.092751Z","submitted_at":"2025-03-13T13:15:28Z","title":"KV-Distill: Nearly Lossless Learnable Context Compression for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10337","snapshot_observed_at":"2026-08-04T23:14:05.348841Z","title":"Kv-distill: Nearly lossless learnable context compression for llms.arXiv preprint arXiv:2503.10337, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:05.348841Z"},"links":{"cited_paper":"/paper/2503.10337","citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:872764be24e019aaa2a59a8218c536958a6122bf31112b9c364d25e9e8df395d","observation_id":"e0926956-1441-459c-9c26-2b041cf3cdf9","resolution":{"observed_at":"2026-08-04T23:14:05.348841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:14:15.090067Z","title":"Learning to compress prompt in natural language formats","venue":null,"work_id":"cd398af2-6986-4d50-883a-b77369559cb6","year":2024},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:05.477552Z"},"links":{"citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:b336ea666c74ae256f7e0ae52198e6089ab1a2d1275708876990a742091c72c4","observation_id":"34ad7e52-2280-443b-aab7-5fe5745e20c7","resolution":{"observed_at":"2026-08-04T23:14:15.205397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.3555","last_updated":"2014-12-11T06:46:53Z","snapshot_observed_at":"2026-08-03T11:40:51.182181Z","submitted_at":"2014-12-11T06:46:53Z","title":"Empirical Evaluation of Gated Recurrent Neural Networks on Sequence Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.3555","snapshot_observed_at":"2026-08-04T23:14:05.666221Z","title":"Empirical evaluation of gated recurrent neural networks on sequence modeling.arXiv preprint arXiv:1412.3555, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:05.666221Z"},"links":{"cited_paper":"/paper/1412.3555","citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:3efe7a09fdd89429b6c1aa0d10ab3e1c90fece934b00ca6dadf5f0e46f64dc50","observation_id":"a5cf0b1b-9438-46ae-b6ed-0992a4b44ffb","resolution":{"observed_at":"2026-08-04T23:14:05.666221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-04T23:14:05.790838Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge.arXiv preprint arXiv:1803.05457, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:05.790838Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:7af0df9c480a2fe1a080e92cc6d5e726ae7bf75b7357b093246e760df8795a7a","observation_id":"80705b35-3476-4122-acde-bde493fc613d","resolution":{"observed_at":"2026-08-04T23:14:05.790838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:14:14.768513Z","title":"Finch: Prompt-guided key-value cache compression for large language models.Transactions of the Association for Computational Linguistics, 12: 1517–1532, 2024","venue":null,"work_id":"dad78c2c-2ec5-4bb1-b70c-8b966fb85d43","year":2024},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:05.921463Z"},"links":{"citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:4c1c61aac9d8c30c40dd84357ea3c422fa9860fbc5fa428414fbdaaf8629ff37","observation_id":"e27ad568-460b-442e-834f-a93ff175d8ad","resolution":{"observed_at":"2026-08-04T23:14:14.905011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:14:06.021143Z","title":"FlashAttention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:06.021143Z"},"links":{"citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:75aaabcc2ba6ce36ad096377b946f5c91e32696b512df8c8a58bb78ea8cb0bf3","observation_id":"b5f6d980-f486-4050-9bff-b202d9aeeab7","resolution":{"observed_at":"2026-08-04T23:14:06.021143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-04T23:14:06.123574Z","title":"Transformers are ssms: Generalized models and efficient algorithms through structured state space duality.arXiv preprint arXiv:2405.21060, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:06.123574Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:fe791538b298687d764582ce5b443c6407af7468eaf403b2d7241bff578c52a0","observation_id":"397eb15a-02c7-4554-994a-8acdc000f1a3","resolution":{"observed_at":"2026-08-04T23:14:06.123574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:14:06.256065Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness.Advances in neural information processing systems, 35:16344–16359, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:06.256065Z"},"links":{"citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:23d1574e213ff17fa357717e5fd232e3a71957197eddc4aee27054d9e4dca156","observation_id":"0d3d0072-0426-4262-8add-27db456a8b19","resolution":{"observed_at":"2026-08-04T23:14:06.256065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06266","last_updated":"2025-06-13T17:58:55Z","snapshot_observed_at":"2026-08-07T05:54:59.580995Z","submitted_at":"2025-06-06T17:48:23Z","title":"Cartridges: Lightweight and general-purpose long context representations via self-study","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06266","snapshot_observed_at":"2026-08-04T23:14:06.389567Z","title":"Cartridges: Lightweight and general-purpose long context representations via self-study.arXiv, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:06.389567Z"},"links":{"cited_paper":"/paper/2506.06266","citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:cd8e6fd4a9620d55fbf6403079a96931a919b221d8c76eafcc492013f606d935","observation_id":"6893cd2a-08e9-45ba-9d42-0f4d153f44cc","resolution":{"observed_at":"2026-08-04T23:14:06.389567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:14:14.421689Z","title":"In-place test-time training","venue":null,"work_id":"8702e860-a07c-4ecf-8cfe-ededc827b2d0","year":null},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:06.547378Z"},"links":{"citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:f0e1115770b76d58118f213d6550a77c631a4d0ca39659f572ed920f3e2f8362","observation_id":"ab97a2d9-9dc7-428e-8d4e-58ab5386247c","resolution":{"observed_at":"2026-08-04T23:14:14.540371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.14052","last_updated":"2023-04-29T03:18:40Z","snapshot_observed_at":"2026-08-06T18:01:24.576458Z","submitted_at":"2022-12-28T17:56:03Z","title":"Hungry Hungry Hippos: Towards Language Modeling with State Space Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.14052","snapshot_observed_at":"2026-08-04T23:14:06.803422Z","title":"Hungry hungry hippos: Towards language modeling with state space models.arXiv preprint arXiv:2212.14052, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:06.803422Z"},"links":{"cited_paper":"/paper/2212.14052","citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:29b900e477d4f944b54b206c2e19118e6cc3e3db3b9bcf13ffb072e5ad6e5fd9","observation_id":"4db8bf9e-d62c-41f2-81bb-8cbed9025657","resolution":{"observed_at":"2026-08-04T23:14:06.803422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-04T23:14:06.952421Z","title":"The pile: An 800gb dataset of diverse text for language modeling.arXiv preprint arXiv:2101.00027, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:06.952421Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:590240402478e3450c3d21e879c574911cfc1bc028499fad01f4da3a5fcdaa2a","observation_id":"8a5ee083-a876-497a-98c1-0df6f402a9a2","resolution":{"observed_at":"2026-08-04T23:14:06.952421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:14:07.065138Z","title":"How to train long-context language models (effectively)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:07.065138Z"},"links":{"citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:c164637f5ac3860d3d133770fdb13283ab91a0c926870c1ef176d3c11e98e4d0","observation_id":"3018c465-52a7-4b15-a788-52b17a2974f7","resolution":{"observed_at":"2026-08-04T23:14:07.065138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-04T23:14:07.185124Z","title":"Model tells you what to discard: Adaptive kv cache compression for llms.arXiv preprint arXiv:2310.01801, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:07.185124Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:65dcbd4089ac94b528eafe69635a762f04a36a197d665878b78ddbb33e7a5842","observation_id":"e8cb5d61-4e89-454f-8152-0cd605d7d62e","resolution":{"observed_at":"2026-08-04T23:14:07.185124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-04T23:14:07.335199Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:07.335199Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:7b01558fe5f3d0e944618cc257c83cbef89a8c6484aff5fdbd2eaab176d76a9b","observation_id":"6622a355-149e-4d57-98bc-2a62bfb730e7","resolution":{"observed_at":"2026-08-04T23:14:07.335199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00396","last_updated":"2022-08-05T17:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-31T03:32:18Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00396","snapshot_observed_at":"2026-08-04T23:14:07.450289Z","title":"Efficiently modeling long sequences with structured state spaces.arXiv preprint arXiv:2111.00396, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:07.450289Z"},"links":{"cited_paper":"/paper/2111.00396","citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:d551ff366b762eee075d88d7b1d46f96ab5e996b768ea1904ce76c40404670db","observation_id":"bd5b79d2-829d-4207-a2d3-d610b49eed4c","resolution":{"observed_at":"2026-08-04T23:14:07.450289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:14:07.584943Z","title":"Log-linear attention.arXiv preprint arXiv:2506.04761, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:07.584943Z"},"links":{"citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:ac7d45168b162c263d3a9306613df54149b0b2f772c2e3d22d0afca3e15ee741","observation_id":"f4a080cd-867c-445a-8964-9940e2d65195","resolution":{"observed_at":"2026-08-04T23:14:07.584943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-04T23:14:07.739124Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:07.739124Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:1d4498ec74598b17228fcfa1a8c9946785315af53cb9ec3edd92782d66f5ad4f","observation_id":"7ab99549-c75e-45c0-856a-64fdb2f73595","resolution":{"observed_at":"2026-08-04T23:14:07.739124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:14:07.880464Z","title":"Long short-term memory.Neural computation, 9(8): 1735–1780, 1997","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:07.880464Z"},"links":{"citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:9125318fe0a8f0aa4d1952ea197d837fce1361fd2952f67c49ca9ca0092a93ad","observation_id":"919ae80d-7d08-4bf1-bdd6-7359d9d19f49","resolution":{"observed_at":"2026-08-04T23:14:07.880464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-04T23:14:08.026195Z","title":"Ruler: What’s the real context size of your long-context language models?arXiv preprint arXiv:2404.06654, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:08.026195Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:9d734244ab14b48136e88d7dc46868ddb71b532fab53be8572060bc11a9fdc95","observation_id":"226c7399-347e-414d-8446-1d605e707c2f","resolution":{"observed_at":"2026-08-04T23:14:08.026195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-04T23:14:08.177389Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies.arXiv preprint arXiv:2404.06395, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:08.177389Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:f658e736cdf9455cbab0ef3e37e96f469a460ef9e887aba1b5d0ccfd52ceac64","observation_id":"64a8102d-d7e0-4921-9932-e63d85c1ac63","resolution":{"observed_at":"2026-08-04T23:14:08.177389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08892","last_updated":"2024-07-11T23:34:32Z","snapshot_observed_at":"2026-08-05T23:46:03.101237Z","submitted_at":"2024-07-11T23:34:32Z","title":"Characterizing Prompt Compression Methods for Long Context Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08892","snapshot_observed_at":"2026-08-04T23:14:08.287634Z","title":"Characteriz- ing prompt compression methods for long context inference.arXiv preprint arXiv:2407.08892, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:08.287634Z"},"links":{"cited_paper":"/paper/2407.08892","citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:084e3048a83c095f7a18455b3ab0633df4ce9e49a115ebf3a7faf1d6ca2a94e1","observation_id":"47553360-1a86-4eaa-980a-4375973611b4","resolution":{"observed_at":"2026-08-04T23:14:08.287634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:14:08.403619Z","title":"Llmlingua: Compress- ing prompts for accelerated inference of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:08.403619Z"},"links":{"citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:a82de27897181e9c08d33f4a0488f084d0db83645ee88166f5a906ff6b0b67a4","observation_id":"0a3b789e-b136-4bbc-8b7d-9dd3a816c0bb","resolution":{"observed_at":"2026-08-04T23:14:08.403619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:14:08.528498Z","title":"Babilong: Testing the limits of llms with long context reasoning-in-a-haystack","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:08.528498Z"},"links":{"citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:661a1f44a0829062dd5c2fc11d5f7c46238086e659032c3e5bbc293361cf5b30","observation_id":"cc9b1233-617f-4401-89d8-72104f18e534","resolution":{"observed_at":"2026-08-04T23:14:08.528498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:14:08.662989Z","title":"The power of scale for parameter-efficient prompt tuning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:08.662989Z"},"links":{"citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:114438ab7ae66c6bc83f9c1832bf34f9c33404f4ac9a0d925d7f7228fa852b0e","observation_id":"a79c02d6-a830-47a0-b543-7f2bf52a67c2","resolution":{"observed_at":"2026-08-04T23:14:08.662989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:14:08.800032Z","title":"Prefix-tuning: Optimizing continuous prompts for generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:08.800032Z"},"links":{"citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:7b6e8783e3daa8a658bf202c2648b894abc9dfc6950996ec5a290f378bfedb0b","observation_id":"13d8cc07-5037-4a8c-b89e-312003fc2828","resolution":{"observed_at":"2026-08-04T23:14:08.800032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:14:08.961052Z","title":"Snapkv: Llm knows what you are looking for before generation.Advances in Neural Information Processing Systems, 37:22947–22970, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:08.961052Z"},"links":{"citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:3b9313d6e694d33f793701eb5f51732412c0c6dffbf43a7d2949d17e067058b6","observation_id":"adbd24ab-f684-4a90-bf00-1f1f4e15b14d","resolution":{"observed_at":"2026-08-04T23:14:08.961052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07143","last_updated":"2024-08-09T22:37:25Z","snapshot_observed_at":"2026-08-02T14:27:24.212588Z","submitted_at":"2024-04-10T16:18:42Z","title":"Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07143","snapshot_observed_at":"2026-08-04T23:14:09.106654Z","title":"Leave no context behind: Efficient infinite context transformers with infini-attention.arXiv preprint arXiv:2404.07143, 101:15, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:09.106654Z"},"links":{"cited_paper":"/paper/2404.07143","citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:94257c01a2c4720f35556a18ed1daeca66e0a70d8bd906dd4a109e1afd349441","observation_id":"816d684a-addd-49aa-b6bc-8a610d2e6e2c","resolution":{"observed_at":"2026-08-04T23:14:09.106654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:14:13.786394Z","title":"Transformers are multi-state rnns","venue":null,"work_id":"48932273-dc34-48a1-8dfc-818ec20331c9","year":2024},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:09.274202Z"},"links":{"citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:fdc8dbb6a4ff59ecd63201798e48e05cf6d1c270eb3161c13a771e0108b9a319","observation_id":"aae81bf1-aa7d-47b8-80a4-fe9c14319503","resolution":{"observed_at":"2026-08-04T23:14:13.881753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:14:09.470969Z","title":"Rwkv: Reinventing rnns for the transformer era","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:09.470969Z"},"links":{"citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:01b9662eb6e9ade04f20beb5fb59a6d6663ef13312edbdd0eb6bea71991944e1","observation_id":"5d86c09b-944d-4fd0-9f10-4e067ac893eb","resolution":{"observed_at":"2026-08-04T23:14:09.470969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17844","last_updated":"2024-08-19T17:26:18Z","snapshot_observed_at":"2026-07-06T17:51:24.261505Z","submitted_at":"2024-03-26T16:33:12Z","title":"Mechanistic Design and Scaling of Hybrid Architectures","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17844","snapshot_observed_at":"2026-08-04T23:14:09.604533Z","title":"Mechanistic design and scaling of hybrid architectures.arXiv preprint arXiv:2403.17844, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:09.604533Z"},"links":{"cited_paper":"/paper/2403.17844","citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:c682796ccdf71f9736d64c8ec0a2349ca939ea4c5335fa1c2c5d7cfc8d3e7411","observation_id":"40fd6dab-2f54-4d83-8ed8-b9ffee9cfd62","resolution":{"observed_at":"2026-08-04T23:14:09.604533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:14:09.767096Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:09.767096Z"},"links":{"citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:bb6e5b19423e74df4840835e48ef9b580ae7d138cb669bb56b95bf747ab7f298","observation_id":"448891ea-e8db-4747-9d84-708f7e159209","resolution":{"observed_at":"2026-08-04T23:14:09.767096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:14:13.491456Z","title":"Linear transformers are secretly fast weight programmers","venue":null,"work_id":"9e783146-1ff8-48b9-ad05-31f383efda08","year":2021},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:09.931300Z"},"links":{"citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:72721209138f160fe93020f47fbba2f47856227b650681a7d1c904bc5aec2842","observation_id":"cf6f7410-8dd1-49e4-add4-177088d2587b","resolution":{"observed_at":"2026-08-04T23:14:13.672391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:14:13.230982Z","title":"FlashAttention-3: Fast and accurate attention with asynchrony and low-precision","venue":null,"work_id":"0bea2f3a-6fb1-453f-9dfb-4a6f38f29c49","year":2024},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:10.050140Z"},"links":{"citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:0a61e561c3e48d80f93f9b30564572a8c7f8dc0e65d9eff527f65fde9d4a7db6","observation_id":"a209b04f-5702-4b86-bd83-513447cfdfd9","resolution":{"observed_at":"2026-08-04T23:14:13.354172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15189","last_updated":"2022-09-30T02:30:15Z","snapshot_observed_at":"2026-08-04T09:41:45.042008Z","submitted_at":"2022-09-30T02:30:15Z","title":"Learning by Distilling Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15189","snapshot_observed_at":"2026-08-04T23:14:10.159095Z","title":"Learning by distilling context.arXiv preprint arXiv:2209.15189, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:10.159095Z"},"links":{"cited_paper":"/paper/2209.15189","citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:54abe25f5fbcd0d2d17a3dc21701640160ee241f422db86fb36de3a865d2e9b6","observation_id":"d702b95c-08f7-4a5f-ae0c-2adbb5ce5d7b","resolution":{"observed_at":"2026-08-04T23:14:10.159095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:14:10.276672Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:10.276672Z"},"links":{"citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:565838b1fdf54cb5f620a36936467bd85d879fba1a3eae47c5d3515a0cf62b87","observation_id":"ef0a8900-bbce-4f3e-81af-7cc143090630","resolution":{"observed_at":"2026-08-04T23:14:10.276672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:14:10.362549Z","title":"Test-time training with self-supervision for generalization under distribution shifts","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:10.362549Z"},"links":{"citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:a27282386a82b61f8ed90d0447dc07b7f38b6320f84076d1312d59450a4c23e3","observation_id":"18a50eff-afb5-4a4c-87b0-6a62d78006cc","resolution":{"observed_at":"2026-08-04T23:14:10.362549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04620","last_updated":"2025-08-31T18:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-05T16:23:20Z","title":"Learning to (Learn at Test Time): RNNs with Expressive Hidden States","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04620","snapshot_observed_at":"2026-08-04T23:14:10.523720Z","title":"Learning to (learn at test time): Rnns with expressive hidden states.arXiv preprint arXiv:2407.04620, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:10.523720Z"},"links":{"cited_paper":"/paper/2407.04620","citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:91a9d0624727f4297bd872d7dec34eb4ce0b218ea83d679dd5503ae3fe08f0bc","observation_id":"d84e59b2-544a-4af1-832a-fc036152c07c","resolution":{"observed_at":"2026-08-04T23:14:10.523720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:14:10.646589Z","title":"End-to-end test-time training for long context.arXiv preprint arXiv:2512.23675, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:10.646589Z"},"links":{"citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:191fd5916b4b91ec71cf654f74f08928eb0e8ff7e14c02bdc2eb422b17d02ca2","observation_id":"d8f1b53f-9c2b-4fee-a59c-f391f420b1b1","resolution":{"observed_at":"2026-08-04T23:14:10.646589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-08-07T19:30:34.681869Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-04T23:14:10.779384Z","title":"Kimi linear: An expressive, efficient attention architecture.arXiv preprint arXiv:2510.26692, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:10.779384Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:4f40d0ea1ebe539ec335c41f1489179af61dc8b7d2de80d062b2899ef759747f","observation_id":"21e81452-944f-4526-99ff-b77dd6ce18f2","resolution":{"observed_at":"2026-08-04T23:14:10.779384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:14:10.965292Z","title":"Long data collections database, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:10.965292Z"},"links":{"citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:40742157f0fd5a83987b9572d832715cb26ac4ec90a85faac04aa5c4c8da67a9","observation_id":"57870a3d-587b-49cf-8ef6-e46b09f61007","resolution":{"observed_at":"2026-08-04T23:14:10.965292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:14:11.133096Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:11.133096Z"},"links":{"citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:ee0ad3b2cd4acde5e4842ab9327f002a60cdeb3ebfc1f86a26734adf57fb1cfd","observation_id":"4315f292-e6c7-41fe-8d5d-f0ea54d47e33","resolution":{"observed_at":"2026-08-04T23:14:11.133096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:14:11.286715Z","title":"Rattention: Towards the minimal sliding window size in local-global attention models.arXiv preprint arXiv:2506.15545, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:11.286715Z"},"links":{"citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:a9491b227e4266142f3e0aaf540f99de249349609886b5236dabc8a55fd01177","observation_id":"6c056be1-e655-4eef-b1f3-07ef8161b56e","resolution":{"observed_at":"2026-08-04T23:14:11.286715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-08T20:24:14.331350Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-04T23:14:11.425305Z","title":"Fantastic pretraining optimizers and where to find them.arXiv preprint arXiv:2509.02046, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:11.425305Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:d41ffcd757ee8044cd77606fa419665608e51b892bc7752db2ff8914a46fabbf","observation_id":"90465926-40c6-49b7-91bd-65939b77e029","resolution":{"observed_at":"2026-08-04T23:14:11.425305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06635","last_updated":"2024-08-27T01:27:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-11T18:51:59Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06635","snapshot_observed_at":"2026-08-04T23:14:11.560413Z","title":"Gated linear attention transformers with hardware-efficient training.arXiv preprint arXiv:2312.06635, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:11.560413Z"},"links":{"cited_paper":"/paper/2312.06635","citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:5b698189f0c355e801c3b04acb033820f1a1ccbcc9944c5902b3c7200852b3bb","observation_id":"d2f92442-bf3a-438a-bc24-b9d17918de0a","resolution":{"observed_at":"2026-08-04T23:14:11.560413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06464","last_updated":"2025-03-06T06:57:34Z","snapshot_observed_at":"2026-08-03T00:27:18.402796Z","submitted_at":"2024-12-09T13:09:04Z","title":"Gated Delta Networks: Improving Mamba2 with Delta Rule","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06464","snapshot_observed_at":"2026-08-04T23:14:11.743368Z","title":"Gated delta networks: Improving mamba2 with delta rule.arXiv preprint arXiv:2412.06464, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:11.743368Z"},"links":{"cited_paper":"/paper/2412.06464","citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:f64e7446b9af51b20f151a9e26aa080b06cbb58190434fab2dbbee24ff324776","observation_id":"43063023-1f75-43e9-a0ab-6981d13021b3","resolution":{"observed_at":"2026-08-04T23:14:11.743368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:14:11.883687Z","title":"Parallelizing linear transformers with the delta rule over sequence length.Advances in neural information processing systems, 37:115491–115522, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:11.883687Z"},"links":{"citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:ac2f0c681c4b992d3b85f05e44154e8da12273b3ebbe179ed8153c0a6acc89b2","observation_id":"610f9608-bdd7-4f16-a98b-796fb62e02d6","resolution":{"observed_at":"2026-08-04T23:14:11.883687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:14:12.075110Z","title":"Native sparse attention: Hardware-aligned and natively trainable sparse attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:12.075110Z"},"links":{"citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:ee29be48f0f2ed837bb4f741fd2a9a6e27629acc040f1620f7413ab02e5dbe35","observation_id":"171207e8-4b27-4a4f-8e1c-4e1c333b3367","resolution":{"observed_at":"2026-08-04T23:14:12.075110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:14:12.201229Z","title":"Hellaswag: Can a machine really finish your sentence? InProceedings of the 57th annual meeting of the association for computational linguistics, pages 4791–4800, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:12.201229Z"},"links":{"citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:36f406d2e08a8fb753ecccbff28ad609db13c0ef5ae1d3a2b512091256b8a951","observation_id":"9aed4c75-ec93-48a7-af42-4a9a1aff78fc","resolution":{"observed_at":"2026-08-04T23:14:12.201229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23884","last_updated":"2025-05-29T17:50:34Z","snapshot_observed_at":"2026-08-08T17:47:51.120243Z","submitted_at":"2025-05-29T17:50:34Z","title":"Test-Time Training Done Right","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23884","snapshot_observed_at":"2026-08-04T23:14:12.314176Z","title":"Test-time training done right.arXiv preprint arXiv:2505.23884, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:12.314176Z"},"links":{"cited_paper":"/paper/2505.23884","citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:aa245ab0601d153d4fa76fe9f08e8cfdc51bbbb7d50bb6b46ebe1da924d5f631","observation_id":"941c35c7-1044-4412-8a89-17dec2777047","resolution":{"observed_at":"2026-08-04T23:14:12.314176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0041.0027","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:14:12.636404Z","title":"up to 1.3×","venue":null,"work_id":"05adb67f-ccfc-4919-bfe0-601c95731274","year":2023},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:12.487890Z"},"links":{"citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:ba75928362271b4ba74c0cc2bedca3687129ce1c672b897f2a84eea9f05c4dc0","observation_id":"76baa423-df23-4828-8c47-e691ab3d19a8","resolution":{"observed_at":"2026-08-04T23:14:12.722467Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:14:14.131833Z","title":null,"venue":null,"work_id":"9da5992b-c3f5-49ff-874a-58d5d5b637c3","year":null},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:06.676734Z"},"links":{"citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:7f2455c4032b0a547c76fb07e18aed36b3f415e02757355e7a2b5d935ad6d7b8","observation_id":"129dc4f6-bd6b-4602-9d85-ca55dde4b2bd","resolution":{"observed_at":"2026-08-04T23:14:14.291009Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T23:32:54.480980Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2608.01672."}