{"as_of":"2026-08-08T23:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c95d2c15c4d7381de778b4bb82e7d7e7b739664405c47def490d8407d76890b6","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:31:02.370982Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T04:23:21.000846Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05229","snapshot_observed_at":"2026-07-14T04:23:21.000846Z","title":"arXiv preprint arXiv:2506.05229 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11614","last_updated":"2026-07-13T14:37:24Z","snapshot_observed_at":"2026-08-07T12:33:44.646398Z","submitted_at":"2026-07-13T14:37:24Z","title":"Extending LLM Context via Associative Recurrent Memory","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-07-14T04:23:21.000846Z"},"links":{"cited_paper":"/paper/2506.05229","citing_paper":"/paper/2607.11614"},"observation_digest":"sha256:dc3d2425df3f37d4227ca6728e65417528eeeeeac7bc3fc3aaea1001ec6e587c","observation_id":"6e868c84-9a6f-493c-87e8-54a3935ed209","resolution":{"observed_at":"2026-07-14T04:23:21.000846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05229/citation-record","integrity":"/paper/2506.05229/integrity","json":"/paper/2506.05229/citation-record.json","paper":"/paper/2506.05229"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.261636Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.261636Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:33f084e30656b51ebc67aa8db0d9b344bf0ac671abdbb24acbac559da008486c","observation_id":"9c374f95-e3d6-4386-a013-da46aa320767","resolution":{"observed_at":"2026-08-07T10:31:02.261636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.701114Z","title":"Beyond attention: Breaking the limits of transformer context length with recurrent memory.Proceedings of the AAAI Conference on Artificial Intelligence, 38(16):17700–17708, Mar","venue":null,"work_id":"1ebbc9b9-65d9-44c0-99e3-8e0291d99116","year":2024},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.265288Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:9e44db29930390d569381a3f2795bc7e4449ecb57ddd4e216b206ad74f7c5417","observation_id":"d25c1ec0-8669-4a9c-ac03-7a5797cc5036","resolution":{"observed_at":"2026-08-07T10:31:02.704827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.268284Z","title":"Recurrent memory transformer.Advances in Neural Information Processing Systems, 35:11079–11091, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.268284Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:18a4eef0dcfd925fd537b694ef53a403c4aea132bdfb06da79bbcbb5e6a029e3","observation_id":"4207d493-347a-4c55-ba5b-7be557c38d82","resolution":{"observed_at":"2026-08-07T10:31:02.268284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.686094Z","title":"Transformer-XL: Attentive language models beyond a fixed-length context","venue":null,"work_id":"7f766239-1aa0-4a54-b3ee-2dad6afa340b","year":2019},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.271595Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:ac42fa6a6b053d50e7db140fd82180d79b20bb62b32c31a754eeb74f01da77c2","observation_id":"c0f5ae5d-3fb9-4a5f-a95e-5094e969e936","resolution":{"observed_at":"2026-08-07T10:31:02.689314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.274470Z","title":"FlashAttention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.274470Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:826d8d4a713032654a876138c2c433ab992f0a3ee8476f40e186cfbc1255ec62","observation_id":"659f308c-5d9b-45a7-b5b8-dd8a7bc1485c","resolution":{"observed_at":"2026-08-07T10:31:02.274470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.278285Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.278285Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:14cdef494465ceff56827d04e7f8ed3c21628706ceed01c4f59441b0a3269ce7","observation_id":"0d966adf-d81c-4b1e-b872-e3777f264d6b","resolution":{"observed_at":"2026-08-07T10:31:02.278285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.281602Z","title":"Transformers are ssms: Generalized models and efficient algorithms through structured state space duality","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.281602Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:9d64c06b4e5a09005c35199ebe2feae68f081baf02c872073375aa902116c54b","observation_id":"9e69cc6b-8429-4fcf-beaf-703d096346a2","resolution":{"observed_at":"2026-08-07T10:31:02.281602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.284382Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.284382Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:1ee6baa2b871a86173c5fe6dad0cfdc07863b51f21cc641640e64fdc22b3ef33","observation_id":"63e6efe4-47ff-4d86-96d6-56b831c19b84","resolution":{"observed_at":"2026-08-07T10:31:02.284382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T08:38:54.025062Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-07T10:31:02.290391Z","title":"GPTQ: Accurate post-training compression for generative pretrained transformers.arXiv preprint arXiv:2210.17323, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.290391Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:1afb5448095991cc1dafb86206d928e7bceffc59e7d758f5f3a6d1b1ff374ce6","observation_id":"0dc6912a-8e4f-49e1-8186-aa6258447905","resolution":{"observed_at":"2026-08-07T10:31:02.290391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T10:31:02.293278Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.293278Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:a1463a330409f8acd50227ee1bc67118a425c4296651174c88fbd7683eed0a5f","observation_id":"51970a9b-c773-4e5b-bb8a-4b182f3fecec","resolution":{"observed_at":"2026-08-07T10:31:02.293278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-07T10:31:02.296240Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.296240Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:fde27a8ff69c76d665b7eedb1008d71a8787970240e1dde5bb7804c9998d8949","observation_id":"f4d68394-a45a-4269-83a1-47e8e8901c27","resolution":{"observed_at":"2026-08-07T10:31:02.296240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.654135Z","title":"Efficiently modeling long sequences with structured state spaces","venue":null,"work_id":"933343b3-8a9b-498f-a310-ed73fe922ab5","year":2021},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.299350Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:521acfa35123a46fa382b5e8d3f7ee37ece3fb5f59659bd0f171a0f643d1dd94","observation_id":"3d6fd564-51f0-4b0b-a66d-81b81589be9e","resolution":{"observed_at":"2026-08-07T10:31:02.657276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.645159Z","title":"Block- recurrent transformers","venue":null,"work_id":"3639f925-8384-4e77-8f13-438ad68d5c7c","year":2022},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.302546Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:1307b3a730d84c979ac5be657d8ad3b944f9dc838a0b5cdaac26eadab127df89","observation_id":"58e1ae87-74e7-490f-937a-497772c33b52","resolution":{"observed_at":"2026-08-07T10:31:02.648133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14509","last_updated":"2023-10-04T16:51:13Z","snapshot_observed_at":"2026-08-04T19:27:31.715261Z","submitted_at":"2023-09-25T20:15:57Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14509","snapshot_observed_at":"2026-08-07T10:31:02.305339Z","title":"Deepspeed ulysses: System optimizations for enabling training of extreme long sequence transformer models.arXiv preprint arXiv:2309.14509, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.305339Z"},"links":{"cited_paper":"/paper/2309.14509","citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:d04f7bbbdafad5cb34d010470c49b155af7b6eb98151ad1e0b20b36f355141af","observation_id":"838a27de-ef3e-4c4c-b721-907f0931281c","resolution":{"observed_at":"2026-08-07T10:31:02.305339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.635092Z","title":"Repeat after me: Transformers are better than state space models at copying","venue":null,"work_id":"40fa4a06-c818-4459-8839-0ac7d7190c77","year":2024},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.308340Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:6b9cdfe1163e06753880651a2692514c0247b285bd01b2f8ca3fbe68f75b8908","observation_id":"80358f58-bed7-4a71-b858-2d185d1c7717","resolution":{"observed_at":"2026-08-07T10:31:02.639062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.310996Z","title":"Babilong: Testing the limits of llms with long context reasoning-in-a-haystack","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.310996Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:2db6a9019075934fd28a36fd6913055585537ccb0f6c5d328d4082d0865109d5","observation_id":"ff8a7535-4026-4e19-9bf9-41e137e5ab77","resolution":{"observed_at":"2026-08-07T10:31:02.310996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.313592Z","title":"xformers: A modular and hack- able transformer modelling library","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.313592Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:f9098896a4820c930d4a1bb5fc15da6c2ed7e2d47c2cd80a30f5cd4016835b59","observation_id":"82506dc2-3f32-43ab-afc1-26f89d91cc8f","resolution":{"observed_at":"2026-08-07T10:31:02.313592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.316146Z","title":"Awq: Activation-aware weight quantization for on-device llm compression and acceleration.Proceedings of Machine Learning and Systems, 6:87–100, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.316146Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:7745bfa42ec98d2ccf3ae0c9b36a6645dcc1920992c080b629cc08b0f21dfb2c","observation_id":"1c4b4d5d-ac10-4b05-9d95-b8186f653680","resolution":{"observed_at":"2026-08-07T10:31:02.316146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-07T10:31:02.319072Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model.arXiv preprint arXiv:2405.04434, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.319072Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:412de73fa451a7535e3b4e52382d2bd37b485c5996d9235d369536c769c23b0e","observation_id":"63fe8f27-6182-4581-9a47-0a261745935a","resolution":{"observed_at":"2026-08-07T10:31:02.319072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.321821Z","title":"Ringattention with blockwise transformers for near-infinite context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.321821Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:3fdc5c488c2e57691e28103567bd843b78592cdca63271f9a019a3ea119999ef","observation_id":"effed22a-408b-42de-bfbf-bda5bc0ea91b","resolution":{"observed_at":"2026-08-07T10:31:02.321821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.601550Z","title":"The illusion of state in state-space models","venue":null,"work_id":"cea5d088-e2c8-4095-871e-8f127ad4217d","year":2024},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.324361Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:f11e5f2cd621f27f9e87c81365f505ae0126d10a6e91b0ab783e88b4342cefcb","observation_id":"561f52c1-139a-4dfc-87e3-f19d3f653d6e","resolution":{"observed_at":"2026-08-07T10:31:02.604978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.327144Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.327144Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:ee22676725e8204b9fb137de8367847d74bbf7539bef92ea3821f08ac8223070","observation_id":"b28ec415-0f93-4bc1-b9e7-e5bce10bca77","resolution":{"observed_at":"2026-08-07T10:31:02.327144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.585025Z","title":"RWKV: Reinventing RNNs for the transformer era","venue":null,"work_id":"e02b55ec-e9f1-4f19-a08d-0665c7c2244d","year":2023},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.329928Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:112d6bc221abb76b7f399fed1bee1f0f38d248269aa35dd4d2e22658fdedc388","observation_id":"5e691474-a32d-4afa-853f-9c51a8199840","resolution":{"observed_at":"2026-08-07T10:31:02.588670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.332527Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.332527Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:7355ab205ff789f2a6d73d4fb6f4894eb1f6e655e92020a992a2d142bf8fe763","observation_id":"92ea202f-dcaf-4a77-9a63-5f1e94a4d52f","resolution":{"observed_at":"2026-08-07T10:31:02.332527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.335195Z","title":"Rae, Anna Potapenko, Siddhant M","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.335195Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:7907a30951482c9670ed1fe5f98257514652480cb52b97fa1026acb257189c2a","observation_id":"8e54fda5-a8c1-4c85-97ab-060e04e22d96","resolution":{"observed_at":"2026-08-07T10:31:02.335195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T10:31:02.337712Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.337712Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:92f3e607eecd3cc2ae64ff407de1e66324eeb2925b0848e47a9a40e945871a9c","observation_id":"a3cae8ee-b43a-470c-b6dd-d7e64b398758","resolution":{"observed_at":"2026-08-07T10:31:02.337712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.563166Z","title":"Associative recurrent memory transformer.CoRR, 2024","venue":null,"work_id":"28d13c00-5936-4aa4-a97f-48645ab9dac6","year":2024},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.340860Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:ba0a382038098eb0aaa56aebe47a6169a7f8aef1db98d5c2b0ed4b89ee05cd69","observation_id":"09640ec0-9f58-4519-ac11-be5c07b70fa0","resolution":{"observed_at":"2026-08-07T10:31:02.566381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.343585Z","title":"Linear transformers are secretly fast weight programmers, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.343585Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:5c684543ea3cb542eb82ee74f53ada8450e0886bd986965415f2f970a5d176ef","observation_id":"80cbd136-aa13-4f71-a90f-9c87954801c4","resolution":{"observed_at":"2026-08-07T10:31:02.343585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-07T10:31:02.346313Z","title":"Fast transformer decoding: One write-head is all you need.arXiv preprint arXiv:1911.02150, 2019","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.346313Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:ef01cb058eef015b88c435209f9f1608d3467b82a4cf4c0c639490f6bc1fb6e9","observation_id":"604e1b7b-7f8b-41d0-b1c3-17602df684f8","resolution":{"observed_at":"2026-08-07T10:31:02.346313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.546574Z","title":"What formal lan- guages can transformers express? a survey.Transactions of the Association for Computational Linguistics, 12, 2024","venue":null,"work_id":"78ee7726-1137-4417-a880-7637824f2008","year":2024},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.349251Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:c47a12373428719bd56191b0d8834a2c456aba03e4171c672b294edfcf048c36","observation_id":"d07d4554-56cf-44a1-8bbe-d551afe35423","resolution":{"observed_at":"2026-08-07T10:31:02.550155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.535882Z","title":"End-to-end memory networks, 2015","venue":null,"work_id":"b5303fce-65ad-42e8-9e1b-adee34914df0","year":2015},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.352422Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:a03b529d1e1bcc3f5449ab85810579421ea15a65afb5778f543fb9eda6ef92fe","observation_id":"7d893457-b33b-4d27-acc2-4715475cc229","resolution":{"observed_at":"2026-08-07T10:31:02.539030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-07T10:31:02.355443Z","title":"Retentive network: A successor to transformer for large language models.arXiv preprint arXiv:2307.08621, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.355443Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:bba4fe6a39debdd2c1c6eda4b146e29aa95e456ef64d76fd5e16ad7a927e502f","observation_id":"acd5a738-db6d-4c66-8f74-cb9716e631f6","resolution":{"observed_at":"2026-08-07T10:31:02.355443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.525113Z","title":"Attention is All you Need","venue":null,"work_id":"d90f80f9-f626-498a-963e-de713b0f71c4","year":2017},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.358877Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:43189ad25be7636991265eb9e7c3ae2e0b4301edd51832c86a8b4806752b4b5c","observation_id":"d5f2c1da-f69c-4a4e-8155-165b9b29e6ab","resolution":{"observed_at":"2026-08-07T10:31:02.528492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.514440Z","title":"Memory networks","venue":null,"work_id":"b5e3c68a-113d-4913-a8ac-2c956300a8c3","year":2015},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.361912Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:2e37b1e48c07551ea05685a6bfb1863f60908bae7a539aac62a7e3d0ba89e0a0","observation_id":"3bb27f15-881d-4c8e-8759-af8aa705d936","resolution":{"observed_at":"2026-08-07T10:31:02.517679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.365308Z","title":"Roofline: an insightful visual performance model for multicore architectures.Communications of the ACM, 52(4):65–76, 2009","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.365308Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:c9ff215f2b45a7002614f57ca18f99d3933f47a64394733749c6014663ec32b2","observation_id":"2b09fa1b-27ad-45fd-9a55-eb962e66f1c4","resolution":{"observed_at":"2026-08-07T10:31:02.365308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.497060Z","title":"Speculative decoding: Exploiting speculative execution for accelerating seq2seq generation","venue":null,"work_id":"5b1ea154-7f4d-4ba8-a6cc-888428debf04","year":2023},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.368282Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:86ca9250d988a70102114026063635b04255918a1de632649ef5566ced030350","observation_id":"72989e82-49cf-416f-99ec-0fdee6f90879","resolution":{"observed_at":"2026-08-07T10:31:02.500498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.485640Z","title":"Parallelizing linear transformers with the delta rule over sequence length","venue":null,"work_id":"a1de373d-e2bc-4101-b8fa-1a6a0f4fa936","year":null},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.370982Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:8f2d9fb1570ec0f930d1d95de8d4838ef8dedb72712fc438f7ccfb7102d786a2","observation_id":"c11b898f-82bb-43a7-b71e-053a83de06c8","resolution":{"observed_at":"2026-08-07T10:31:02.490451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T10:19:57.093233Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 1 inbound Pith citation observation for arXiv:2506.05229."}