{"as_of":"2026-08-09T02:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fed01f3bed949fa31ece53fb05c074b8687457e06669a55ae756906cd089c1ac","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:34:48.726772Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T14:02:35.245972Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T23:43:51.237854Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"cited_work":{"arxiv_id":"2506.17671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17671","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2506.17671 , year=","venue":null,"work_id":"dac054b9-6c44-4d92-ad5b-70bb595bd20a","year":null},"citing_paper":{"arxiv_id":"2605.16350","last_updated":"2026-05-08T04:31:46Z","snapshot_observed_at":"2026-07-06T23:27:29.931962Z","submitted_at":"2026-05-08T04:31:46Z","title":"Federated Nested Learning: Collaborative Training of Self-Referential Memories for Test-Time Adaptation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-20T23:41:14.887651Z"},"links":{"cited_paper":"/paper/2506.17671","citing_paper":"/paper/2605.16350"},"observation_digest":"sha256:64635fbfb093f61ed66cb5113d43b5e82f6727fbf99645052ed08cefe6f76b56","observation_id":"a810ea4f-6889-4f42-ae02-17d8861ab7a7","resolution":{"observed_at":"2026-05-20T23:43:51.239271Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17671","snapshot_observed_at":"2026-08-01T14:02:35.245972Z","title":"doi:10.48550/arXiv.2506.17671 , urldate =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18899","last_updated":"2026-07-21T09:37:55Z","snapshot_observed_at":"2026-08-07T01:07:05.799281Z","submitted_at":"2026-07-21T09:37:55Z","title":"Black-Mamba: Biologically-Inspired Leaky Accumulation for Conceptual Knowledge under Distribution Drift","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T14:02:35.245972Z"},"links":{"cited_paper":"/paper/2506.17671","citing_paper":"/paper/2607.18899"},"observation_digest":"sha256:efb3fff1b48cadd0a60712645a58e7dc79f790d48127875d3ff7e221a8e1a8d6","observation_id":"47d1460d-280d-4d5f-b7a2-e32be4c589f4","resolution":{"observed_at":"2026-08-01T14:02:35.245972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.17671/citation-record","integrity":"/paper/2506.17671/integrity","json":"/paper/2506.17671/citation-record.json","paper":"/paper/2506.17671"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T23:34:45.080735Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609 , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:45.080735Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.17671"},"observation_digest":"sha256:cc0addec8197956f9f5aa157cf649be8a2fb46a1e29ff657e35ea79e63707629","observation_id":"1ec4e09b-a51e-4dbf-b4b3-7cade0850fa4","resolution":{"observed_at":"2026-08-06T23:34:45.080735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13173","last_updated":"2025-04-17T17:59:33Z","snapshot_observed_at":"2026-08-07T16:01:21.030997Z","submitted_at":"2025-04-17T17:59:33Z","title":"It's All Connected: A Journey Through Test-Time Memorization, Attentional Bias, Retention, and Online Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13173","snapshot_observed_at":"2026-08-06T23:34:45.116726Z","title":"It’s all connected: A journey through test-time memorization, attentional bias, retention, and online optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:45.116726Z"},"links":{"cited_paper":"/paper/2504.13173","citing_paper":"/paper/2506.17671"},"observation_digest":"sha256:7f5ed0e59a4706584e9a76e1d34859755f159ffb9a18ee18298b5d886f72ca18","observation_id":"8b7ea0d4-e7fd-4d84-b4a8-52538cd4b30a","resolution":{"observed_at":"2026-08-06T23:34:45.116726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00663","last_updated":"2024-12-31T22:32:03Z","snapshot_observed_at":"2026-08-07T09:00:33.558814Z","submitted_at":"2024-12-31T22:32:03Z","title":"Titans: Learning to Memorize at Test Time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00663","snapshot_observed_at":"2026-08-06T23:34:45.170666Z","title":"Titans: Learning to memorize at test time.arXiv preprint arXiv:2501.00663, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:45.170666Z"},"links":{"cited_paper":"/paper/2501.00663","citing_paper":"/paper/2506.17671"},"observation_digest":"sha256:c9428de1bfc4e2edf54b6cf4974922d2d5b5cc7371bb2756c4c854b1c0045156","observation_id":"34188fda-ff50-4700-a33f-c50609302296","resolution":{"observed_at":"2026-08-06T23:34:45.170666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.14794","last_updated":"2022-11-19T12:45:21Z","snapshot_observed_at":"2026-08-08T20:36:21.234658Z","submitted_at":"2020-09-30T17:09:09Z","title":"Rethinking Attention with Performers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.14794","snapshot_observed_at":"2026-08-06T23:34:45.265877Z","title":"Rethinking attention with performers","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:45.265877Z"},"links":{"cited_paper":"/paper/2009.14794","citing_paper":"/paper/2506.17671"},"observation_digest":"sha256:718b6be3cdb037526827e745f9ac45e3592e13775fe202f4a1ac4b8b5325cfc3","observation_id":"daf8618f-a457-4dc5-ba81-59495993e7d3","resolution":{"observed_at":"2026-08-06T23:34:45.265877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-06T23:34:45.454745Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning.arXiv preprint arXiv:2307.08691, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:45.454745Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2506.17671"},"observation_digest":"sha256:633fbeae44b84459b03bed74fc1a8aa95435efbd305a0a2eba7b899a529c3cd3","observation_id":"47f08d6e-57d1-4a3a-b9a3-2f057d6d172a","resolution":{"observed_at":"2026-08-06T23:34:45.454745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-06T23:34:45.611500Z","title":"Transformers are ssms: Generalized models and efficient algorithms through structured state space duality.arXiv preprint arXiv:2405.21060 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:45.611500Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2506.17671"},"observation_digest":"sha256:61571a2f58215baf55bb02da58688a4ebb8a049c274d5fd7359a366d3a202dc7","observation_id":"3572c2d4-deb6-4df9-80a8-02877e4100f9","resolution":{"observed_at":"2026-08-06T23:34:45.611500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:51.118839Z","title":"Bert: Pre-training of deep bidi- rectional transformers for language understanding","venue":null,"work_id":"1648d864-6541-4638-ad93-194d1953119a","year":2019},"citing_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:45.698479Z"},"links":{"citing_paper":"/paper/2506.17671"},"observation_digest":"sha256:5ba18ff9e8a6674418d0a62f7a0f5b991f99df23f973d8b2e70e6346b01c3a6b","observation_id":"a5f78074-2cd3-4f7f-a3f5-d5c2d36beb0b","resolution":{"observed_at":"2026-08-06T23:34:51.198763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T23:34:45.800061Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.arXiv preprint arXiv:2010.11929 , 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:45.800061Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.17671"},"observation_digest":"sha256:690f8687daaa96b2b735e88ce77f5d7d9f85581d738e765b063be4e668d39c51","observation_id":"b7c92f0a-8261-4796-be48-0e04be0fbe9d","resolution":{"observed_at":"2026-08-06T23:34:45.800061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:50.888712Z","title":"Lora - hugging face peft documentation","venue":null,"work_id":"87d31af6-be33-4341-b949-4b9939564e3e","year":2024},"citing_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:45.897628Z"},"links":{"citing_paper":"/paper/2506.17671"},"observation_digest":"sha256:dcb81571b16b81d7a3ce7a5efdf449cf4d4efc26bc47e69a382c54b7200fdc9a","observation_id":"5d9c5f75-49ee-47f1-ae70-9f44ff6dd367","resolution":{"observed_at":"2026-08-06T23:34:51.009732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00838","last_updated":"2024-06-07T21:59:52Z","snapshot_observed_at":"2026-07-06T17:23:51.547578Z","submitted_at":"2024-02-01T18:28:55Z","title":"OLMo: Accelerating the Science of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00838","snapshot_observed_at":"2026-08-06T23:34:46.034748Z","title":"Olmo: Accelerating the science of language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:46.034748Z"},"links":{"cited_paper":"/paper/2402.00838","citing_paper":"/paper/2506.17671"},"observation_digest":"sha256:27f169858da21e130ac1a6c670ce4c0eb0bc365ab814ad12aad2bac8f5116750","observation_id":"93e42bd2-9816-4616-ac7c-3d3444b57719","resolution":{"observed_at":"2026-08-06T23:34:46.034748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-06T23:34:46.161689Z","title":"Mamba: Linear-time sequence modeling with selective state spaces.arXiv preprint arXiv:2312.00752, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:46.161689Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2506.17671"},"observation_digest":"sha256:48438805f52a2cf398abdaf09ff1e434841c58e5d2227d48489ce1dc3f0e9e89","observation_id":"4d55c19d-5ad2-4dba-bd2b-ae7be2193eee","resolution":{"observed_at":"2026-08-06T23:34:46.161689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-06T23:34:46.194931Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300 , 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:46.194931Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.17671"},"observation_digest":"sha256:1708bd17f95dc2a6e709a2306bcc17611707a6e8f0d8d1b1cb0b62fa2cfb9d76","observation_id":"16112627-729f-42ed-bf11-fb52fdf6bb03","resolution":{"observed_at":"2026-08-06T23:34:46.194931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:46.355340Z","title":"Lora: Low-rank adaptation of large language models.ICLR, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:46.355340Z"},"links":{"citing_paper":"/paper/2506.17671"},"observation_digest":"sha256:a7d07fbf4fbbc6160447f15b5c856c63916dd7fd20626b84740680c8d70e27e4","observation_id":"d73a785d-e3d5-41d3-acdf-c13d4e76312a","resolution":{"observed_at":"2026-08-06T23:34:46.355340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:50.678826Z","title":"Jiang and all Mistral team","venue":null,"work_id":"c17cb260-33ce-4dc6-8963-64b5bca7a357","year":2023},"citing_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:46.464066Z"},"links":{"citing_paper":"/paper/2506.17671"},"observation_digest":"sha256:e79663634f7f8eaff252c30aa69f658925971014dbde6a6889b635447debc66e","observation_id":"0c76ca80-4926-4925-a5b0-0df37af3383e","resolution":{"observed_at":"2026-08-06T23:34:50.786556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:50.509591Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":null,"work_id":"7c96b0cc-a156-4c70-9014-436a0f68c34e","year":2020},"citing_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:46.663137Z"},"links":{"citing_paper":"/paper/2506.17671"},"observation_digest":"sha256:a60e2c8265bbd7c3ffe0ca8da34c7a6a724a24b1a17999dfce61bb4de1474e54","observation_id":"a9882323-0095-4026-949c-8c7e9223a4a9","resolution":{"observed_at":"2026-08-06T23:34:50.590682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01496","last_updated":"2025-05-07T07:42:11Z","snapshot_observed_at":"2026-08-07T17:33:48.516961Z","submitted_at":"2025-03-03T13:08:00Z","title":"Liger: Linearizing Large Language Models to Gated Recurrent Structures","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01496","snapshot_observed_at":"2026-08-06T23:34:46.813241Z","title":"Liger: Linearizing large language models to gated recurrent structures.arXiv preprint arXiv:2503.01496 , 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:46.813241Z"},"links":{"cited_paper":"/paper/2503.01496","citing_paper":"/paper/2506.17671"},"observation_digest":"sha256:d8e489a5d9ae116c26a045c3a8375d3cd6efe2fa63fc23d3d405607cd75d9f50","observation_id":"cc375e24-1f4e-4dbb-818b-8f96341d2f05","resolution":{"observed_at":"2026-08-06T23:34:46.813241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-06T23:34:46.956734Z","title":"Language models are few-shot learners.arXiv preprint arXiv:2005.14165 , 1:3, 2020","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:46.956734Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2506.17671"},"observation_digest":"sha256:075521ef44300ac6ed0b44bb1da7b9760cdd3446596588913a20b953f8cc40b4","observation_id":"3e1bf545-039e-4d5c-a465-f7183bd2a320","resolution":{"observed_at":"2026-08-06T23:34:46.956734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:50.301169Z","title":"Openelm: An efficient language model family with open-source training and inference framework.arXiv e-prints, pages arXiv–2404, 2024","venue":null,"work_id":"96d7b832-ebf7-468c-8dda-9aa53f4ce8ec","year":2024},"citing_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:47.085056Z"},"links":{"citing_paper":"/paper/2506.17671"},"observation_digest":"sha256:84b5bcc6c36af146dadc02f198bc003a68646ecb7005331ca6316f53db00d052","observation_id":"72fc9516-f739-4581-990c-54f71b667efe","resolution":{"observed_at":"2026-08-06T23:34:50.424664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06640","last_updated":"2024-05-10T17:59:08Z","snapshot_observed_at":"2026-08-07T04:56:53.120063Z","submitted_at":"2024-05-10T17:59:08Z","title":"Linearizing Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.06640","snapshot_observed_at":"2026-08-06T23:34:47.210623Z","title":"Linearizing large language models.arXiv preprint arXiv:2405.06640 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:47.210623Z"},"links":{"cited_paper":"/paper/2405.06640","citing_paper":"/paper/2506.17671"},"observation_digest":"sha256:1411bb03d3f37366b38c35ac1d8fcf350bf9fc670d28404a4d043809e4923f97","observation_id":"40e04140-7b47-419f-b80c-d557b484fde3","resolution":{"observed_at":"2026-08-06T23:34:47.210623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08819","last_updated":"2025-03-05T23:00:57Z","snapshot_observed_at":"2026-07-06T17:59:38.202928Z","submitted_at":"2024-04-12T21:30:06Z","title":"The Illusion of State in State-Space Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08819","snapshot_observed_at":"2026-08-06T23:34:47.274822Z","title":"The illusion of state in state-space models.arXiv preprint arXiv:2404.08819, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:47.274822Z"},"links":{"cited_paper":"/paper/2404.08819","citing_paper":"/paper/2506.17671"},"observation_digest":"sha256:e9d907e85da2cc83164ec7185dee4437482b883a01a5951f06943fdbcb2dbe5a","observation_id":"0e10e554-38d7-4b63-9a61-215e768e025a","resolution":{"observed_at":"2026-08-06T23:34:47.274822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02060","last_updated":"2025-03-03T01:25:46Z","snapshot_observed_at":"2026-07-29T16:11:06.082798Z","submitted_at":"2024-09-03T17:08:20Z","title":"OLMoE: Open Mixture-of-Experts Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02060","snapshot_observed_at":"2026-08-06T23:34:47.387361Z","title":"Olmoe: Open mixture-of-experts language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:47.387361Z"},"links":{"cited_paper":"/paper/2409.02060","citing_paper":"/paper/2506.17671"},"observation_digest":"sha256:55ecc3804b563fdf75c39d317de49c52c291c8111ef4c976091f0015e2d9befb","observation_id":"baa28aaa-37c5-4746-a0ed-4a4ef2921bcb","resolution":{"observed_at":"2026-08-06T23:34:47.387361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-06T23:34:47.534750Z","title":"Rwkv: Reinventing rnns for the transformer era.arXiv preprint arXiv:2305.13048, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:47.534750Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2506.17671"},"observation_digest":"sha256:db350f9628297a73734bfdc4520ee73c4e6f8a66488ca1272e283b6500c4de57","observation_id":"100ac0ea-d60b-4b96-9712-1da2ac80d36c","resolution":{"observed_at":"2026-08-06T23:34:47.534750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T23:34:47.659435Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:47.659435Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.17671"},"observation_digest":"sha256:cbc8dbd3023abce7b531bee1b3923be0369301408682e6a9285ca6c8ffd50554","observation_id":"33f593a6-e103-4ee4-9028-e23b41f95325","resolution":{"observed_at":"2026-08-06T23:34:47.659435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:47.823694Z","title":"Deltaproduct: Improving state-tracking in linear rnns via householder products","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:47.823694Z"},"links":{"citing_paper":"/paper/2506.17671"},"observation_digest":"sha256:ea92ec6c5e3e0ec6ecf033486da4ed6b56ccd86fe02b4301c1e17fc1070a10b6","observation_id":"b1170e07-3796-401a-8362-58fd1fed7b57","resolution":{"observed_at":"2026-08-06T23:34:47.823694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:50.074428Z","title":"Alpaca: A strong, replicable instruction-following model.Stanford Center for Research on Foundation Models","venue":null,"work_id":"f45b2e80-5bd9-49b6-a8fa-cc1e4d93c9db","year":2023},"citing_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:47.897344Z"},"links":{"citing_paper":"/paper/2506.17671"},"observation_digest":"sha256:ac352cec49993d5808b9c122d00461ec8770bbf9a54fccea76070b06dc50d037","observation_id":"d48bbe81-7b06-4aec-9d20-71c12f50bf49","resolution":{"observed_at":"2026-08-06T23:34:50.187128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-06T23:34:48.045442Z","title":"Gemma 3 technical report.arXiv preprint arXiv:2503.19786, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:48.045442Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2506.17671"},"observation_digest":"sha256:b79d19f5111a7cc9d30c6eed66392e65f742f88fa4eb1ec7375ae446d881b03c","observation_id":"dd9da59a-d08b-40c6-8004-d8d7967abfa8","resolution":{"observed_at":"2026-08-06T23:34:48.045442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T23:34:48.149039Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:48.149039Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.17671"},"observation_digest":"sha256:fda1fa1754c172e1f753512392e280a78c540f45c9e007ce3658b40d38d1ec9d","observation_id":"da556d34-e987-43df-9601-931953106965","resolution":{"observed_at":"2026-08-06T23:34:48.149039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:48.337710Z","title":"Attention is all you need.Advances in neural information processing systems , 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:48.337710Z"},"links":{"citing_paper":"/paper/2506.17671"},"observation_digest":"sha256:e8bdb02cef8e9e28c94cf0f9e7c11ae5719c35e532839acf0d734c2fa03640f7","observation_id":"8a99ca83-3241-4da8-8e03-ded4c01afcb9","resolution":{"observed_at":"2026-08-06T23:34:48.337710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-08-06T23:34:48.427452Z","title":"Linformer: Self-attention with linear complexity","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:48.427452Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2506.17671"},"observation_digest":"sha256:9e56766d3f3b1157eed455db8a86b017ae87b8cdb72c006c078f2cdbbeb64adc","observation_id":"74404f03-18cf-4dd9-bf45-ed16d4537a4e","resolution":{"observed_at":"2026-08-06T23:34:48.427452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-08-06T23:34:48.547568Z","title":"Parallelizing linear transformers with the delta rule over sequence length.arXiv preprint arXiv:2406.06484 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:48.547568Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2506.17671"},"observation_digest":"sha256:9d732fbf0eabfa02dde4a8d99cf9a47f9e1b4d411161054a84e814a623bae31c","observation_id":"1e1eccb2-dc13-48c8-b255-08e6364afbe2","resolution":{"observed_at":"2026-08-06T23:34:48.547568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15487","last_updated":"2025-08-21T12:09:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-21T12:09:58Z","title":"Dream 7B: Diffusion Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15487","snapshot_observed_at":"2026-08-06T23:34:48.663768Z","title":"Dream 7b: Diffusion large language models.arXiv preprint arXiv:2508.15487 , 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:48.663768Z"},"links":{"cited_paper":"/paper/2508.15487","citing_paper":"/paper/2506.17671"},"observation_digest":"sha256:fbc38ca6fc7ce6a9392476d12259eef689f56e226b0cd0506d020cf9d046864c","observation_id":"df9f8a2d-516a-4340-833a-e8c274bb271a","resolution":{"observed_at":"2026-08-06T23:34:48.663768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10254","last_updated":"2025-03-05T21:57:04Z","snapshot_observed_at":"2026-08-05T10:56:29.177473Z","submitted_at":"2024-10-14T08:10:34Z","title":"LoLCATs: On Low-Rank Linearizing of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10254","snapshot_observed_at":"2026-08-06T23:34:48.726772Z","title":"Lolcats: On low-rank linearizing of large language models.arXiv preprint arXiv:2410.10254, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:48.726772Z"},"links":{"cited_paper":"/paper/2410.10254","citing_paper":"/paper/2506.17671"},"observation_digest":"sha256:097e0ab5fb5c10f928ff96b12e509992c932d697f66a247183f95106172bfbf7","observation_id":"96bf899d-d7ca-43ea-b338-d469d97cd370","resolution":{"observed_at":"2026-08-06T23:34:48.726772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.17671","last_updated":"2025-08-31T14:32:19Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T04:58:05.450674Z","submitted_at":"2025-06-21T10:06:07Z","title":"TPTT: Transforming Pretrained Transformers into Titans"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 2 inbound Pith citation observations for arXiv:2506.17671."}