{"as_of":"2026-08-14T15:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1429d83c13ea0cb8d48b1e2eac51fa4c4784dbcf331e0329bb660b5380da916e","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:00:43.819726Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T08:36:31.022046Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T08:39:53.568674Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"cited_work":{"arxiv_id":"2507.04239","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04239","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling context requires rethinking attention","venue":null,"work_id":"5dd8f6cc-d530-47ca-b248-bc01d429cb5f","year":2025},"citing_paper":{"arxiv_id":"2605.15156","last_updated":"2026-05-20T17:53:38Z","snapshot_observed_at":"2026-08-12T16:16:23.095804Z","submitted_at":"2026-05-14T17:51:34Z","title":"MeMo: Memory as a Model","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-15T03:17:23.202604Z"},"links":{"cited_paper":"/paper/2507.04239","citing_paper":"/paper/2605.15156"},"observation_digest":"sha256:d1d9b7cabab0cc119a1c7d7120c2a109a2e01e45d2aab7f175e5ce992e07e8b6","observation_id":"2b7fe290-ff18-4b06-b3a3-4ec28343dc6c","resolution":{"observed_at":"2026-05-15T03:19:43.560611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"cited_work":{"arxiv_id":"2507.04239","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04239","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling context requires rethinking attention","venue":null,"work_id":"5dd8f6cc-d530-47ca-b248-bc01d429cb5f","year":2025},"citing_paper":{"arxiv_id":"2605.15156","last_updated":"2026-05-20T17:53:38Z","snapshot_observed_at":"2026-08-12T16:16:23.095804Z","submitted_at":"2026-05-14T17:51:34Z","title":"MeMo: Memory as a Model","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-21T08:36:31.022046Z"},"links":{"cited_paper":"/paper/2507.04239","citing_paper":"/paper/2605.15156"},"observation_digest":"sha256:b32ab0746b70874a52b7762a0f7a959ad9ce16bffe0cfa77b39e33d540288494","observation_id":"bad90f9a-c9f3-41fc-b6f0-ac00426ca8ef","resolution":{"observed_at":"2026-05-21T08:39:53.570748Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.04239/citation-record","integrity":"/paper/2507.04239/integrity","json":"/paper/2507.04239/citation-record.json","paper":"/paper/2507.04239"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.18668","last_updated":"2025-03-07T18:57:52Z","snapshot_observed_at":"2026-08-13T04:07:54.136779Z","submitted_at":"2024-02-28T19:28:27Z","title":"Simple linear attention language models balance the recall-throughput tradeoff","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18668","snapshot_observed_at":"2026-08-06T20:00:43.702613Z","title":"Simple linear attention language models balance the recall-throughput tradeoff, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.702613Z"},"links":{"cited_paper":"/paper/2402.18668","citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:725fd9863678d67543461feca1bafe15b315cf4484b220930de52c14f55aca07","observation_id":"806947b3-1b67-4409-ad1a-8a2be8ae87d1","resolution":{"observed_at":"2026-08-06T20:00:43.702613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:00:44.198602Z","title":"Longcrawl64: A Long-Context Natural-Language Dataset","venue":null,"work_id":"f8a9c181-62c8-435b-bb9e-1266bd25491c","year":2024},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.706036Z"},"links":{"citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:179d4eee4e1a231c130b6114c8eed4e7ee04cb2b25d518e55e104bb88af73f31","observation_id":"9a321be9-a37a-4f46-a65d-35fc9f223481","resolution":{"observed_at":"2026-08-06T20:00:44.201678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:00:44.188299Z","title":"Linear Transformers Are Faster , a","venue":null,"work_id":"67eccd52-512c-49e0-96f7-372a99a42bf6","year":null},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.708523Z"},"links":{"citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:44b69ee86ff4f15bf3d852efbae336e18596e10c153f94f7442ea275b1fd35ba","observation_id":"0abaa931-dfa5-4c06-958a-3d57200f1425","resolution":{"observed_at":"2026-08-06T20:00:44.192187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:00:44.178932Z","title":"Compute-optimal Context Size , b","venue":null,"work_id":"e8ae99fe-a07b-4dec-8d2e-436e1f65c9e7","year":null},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.711133Z"},"links":{"citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:1911b11e895015e5bee2a3a5f9969e468ef5db2e714ffe15e4a04f96c6a7926f","observation_id":"15001e67-4366-4567-8552-779981a77fdd","resolution":{"observed_at":"2026-08-06T20:00:44.182758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-09T19:46:04.857927Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-06T20:00:43.713677Z","title":"Generating long sequences with sparse transformers","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.713677Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:629c830979a1bd91c3c20e15a1d4d09ae59f28608bb34441bc7256d2cbbc332d","observation_id":"d9ba248b-f5c5-4491-b746-6e7437920c18","resolution":{"observed_at":"2026-08-06T20:00:43.713677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1259","last_updated":"2014-10-07T18:08:30Z","snapshot_observed_at":"2026-07-06T03:53:24.366023Z","submitted_at":"2014-09-03T21:03:41Z","title":"On the Properties of Neural Machine Translation: Encoder-Decoder Approaches","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1259","snapshot_observed_at":"2026-08-06T20:00:43.716373Z","title":"On the properties of neural machine translation: Encoder-decoder approaches, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.716373Z"},"links":{"cited_paper":"/paper/1409.1259","citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:4299fae1b93513984244b02313ee207fd563246f32f224ec7e25b8988642fdb1","observation_id":"d5c7cf42-5e9b-4121-9364-663a5a3cd104","resolution":{"observed_at":"2026-08-06T20:00:43.716373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-06T20:00:43.719428Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.719428Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:652c447adb5bd5670a1510bfd84666cd1da5f2332b393a2f8aa797587e343a81","observation_id":"0978e1f9-25f3-4539-9e45-37c51c68da28","resolution":{"observed_at":"2026-08-06T20:00:43.719428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14135","last_updated":"2022-06-23T17:53:32Z","snapshot_observed_at":"2026-07-06T13:14:48.753329Z","submitted_at":"2022-05-27T17:53:09Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14135","snapshot_observed_at":"2026-08-06T20:00:43.722179Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.722179Z"},"links":{"cited_paper":"/paper/2205.14135","citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:c8b9c25bbe751399e8497775625266ff27684cf9dc6e2a4e34e7a7ba67eef57e","observation_id":"6e66f1c1-9f1e-42e9-be49-a96ac5c27d8a","resolution":{"observed_at":"2026-08-06T20:00:43.722179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T20:00:43.725247Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.725247Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:e84d63a857afd87da7eb693877ca74b6c83404843dcdeb5b6fa156c77a12113a","observation_id":"ddf830bd-01d7-40a6-9941-b9507839b3f1","resolution":{"observed_at":"2026-08-06T20:00:43.725247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:00:44.170034Z","title":"Finding structure in time","venue":null,"work_id":"07383ddf-06ba-4e12-bb55-4989dffe456c","year":1990},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.728543Z"},"links":{"citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:debc7b70aacce55a115140d4067213f018e0912ed3e34e0e50ff23d2cf67c335","observation_id":"69a5748b-8c6b-46e2-8da6-302d91a41462","resolution":{"observed_at":"2026-08-06T20:00:44.173365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T20:00:43.730959Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.730959Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:0e36e26270a47965b7ea65874b24fe91fb3c5e3a2a397a6ff3b4800425f82dd0","observation_id":"7b99b5a7-1dfb-4cc0-95df-bbdf01566434","resolution":{"observed_at":"2026-08-06T20:00:43.730959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T20:00:43.734213Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.734213Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:827fbac4b4cc3b8bef9ec852d53d83d42975122cd329b874e798b1cefb974f69","observation_id":"70f9c2c1-47d3-4361-9236-70e41fe50a23","resolution":{"observed_at":"2026-08-06T20:00:43.734213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-06T20:00:43.737347Z","title":"Mamba: Linear-time sequence modeling with selective state spaces, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.737347Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:1f333519475b46e8d01fbbe5bbfd309b5845b2bcaf4646d0dcd1dfc68bdb6c22","observation_id":"0b8fa29c-d77e-4367-86c1-9654208051d3","resolution":{"observed_at":"2026-08-06T20:00:43.737347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10781","last_updated":"2025-03-02T14:37:53Z","snapshot_observed_at":"2026-08-02T20:46:05.666977Z","submitted_at":"2024-10-14T17:50:28Z","title":"When Attention Sink Emerges in Language Models: An Empirical View","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10781","snapshot_observed_at":"2026-08-06T20:00:43.739897Z","title":"When attention sink emerges in language models: An empirical view","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.739897Z"},"links":{"cited_paper":"/paper/2410.10781","citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:bcebc8b2103f6369db53dfb9e4b23f322d0ecf7b795f38cd407e1fc14027d1cd","observation_id":"e7dee07c-5c78-4154-b17a-4e4f653279ec","resolution":{"observed_at":"2026-08-06T20:00:43.739897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13919","last_updated":"2024-06-06T18:37:34Z","snapshot_observed_at":"2026-08-09T21:47:22.232349Z","submitted_at":"2024-01-25T03:33:18Z","title":"WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13919","snapshot_observed_at":"2026-08-06T20:00:43.742516Z","title":"Webvoyager: Building an end-to-end web agent with large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.742516Z"},"links":{"cited_paper":"/paper/2401.13919","citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:45591df106017b76e37cbad0f41c2b89368c450a64cc21ab7db013aa2b894ec6","observation_id":"36c4efca-16b9-4620-97ea-a1d6f297582e","resolution":{"observed_at":"2026-08-06T20:00:43.742516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:00:43.744949Z","title":"Long short-term memory","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.744949Z"},"links":{"citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:7eb359835684dc80c6ade42b4466cd984d667d61e2f1008a56651f92df5ae9bb","observation_id":"0865f8c0-b0b2-458c-87e7-40961735e0e1","resolution":{"observed_at":"2026-08-06T20:00:43.744949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-08-12T14:56:35.025839Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-06T20:00:43.747356Z","title":"Swe-bench: Can language models resolve real-world github issues? arXiv preprint arXiv:2310.06770, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.747356Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:23b97fb0bdfe2847bf47948dd3899f2932ba836465910fda1acd37a79ed9acd9","observation_id":"8cd1a049-5c67-4165-8e5a-e0919b18d594","resolution":{"observed_at":"2026-08-06T20:00:43.747356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01655","last_updated":"2024-03-17T23:35:24Z","snapshot_observed_at":"2026-08-13T05:58:52.628139Z","submitted_at":"2023-10-02T21:39:04Z","title":"PolySketchFormer: Fast Transformers via Sketching Polynomial Kernels","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01655","snapshot_observed_at":"2026-08-06T20:00:43.750108Z","title":"Polysketchformer: Fast transformers via sketching polynomial kernels, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.750108Z"},"links":{"cited_paper":"/paper/2310.01655","citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:f484c1b1fbca519d874bb576dd649a3f4326f99d280c5de884ac1ef9e289dfff","observation_id":"ef787ccc-dac0-446e-8a76-843fe5a4ab0e","resolution":{"observed_at":"2026-08-06T20:00:43.750108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T20:00:43.752612Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.752612Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:ddf0972dbd53079c31795592e06d00c0d25cfa1c36553ff57cdbaba0e32353b0","observation_id":"f69a656e-d9db-4e04-8f5f-c410780c7f0e","resolution":{"observed_at":"2026-08-06T20:00:43.752612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-08-06T20:00:43.755014Z","title":"Katharopoulos, A","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.755014Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:ae1acbd90e2c133acf9768fb3d01a8376afbf8aaf26d4361cfcd11d244a2f7c2","observation_id":"0f3f5402-67c2-40bd-8261-d2e154e12313","resolution":{"observed_at":"2026-08-06T20:00:43.755014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19887","last_updated":"2024-07-03T14:30:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T23:55:06Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19887","snapshot_observed_at":"2026-08-06T20:00:43.757762Z","title":"Jamba: A hybrid transformer-mamba language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.757762Z"},"links":{"cited_paper":"/paper/2403.19887","citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:466dbc097dde880191499a8228bc814538a6b99313fb48ddc0329e40649ed1a2","observation_id":"c9134b95-095e-43d3-aab2-45a25ed496f2","resolution":{"observed_at":"2026-08-06T20:00:43.757762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02130","last_updated":"2025-03-31T19:41:52Z","snapshot_observed_at":"2026-08-11T22:03:26.894106Z","submitted_at":"2025-03-03T23:35:23Z","title":"Forgetting Transformer: Softmax Attention with a Forget Gate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02130","snapshot_observed_at":"2026-08-06T20:00:43.760372Z","title":"Forgetting transformer: Softmax attention with a forget gate","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.760372Z"},"links":{"cited_paper":"/paper/2503.02130","citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:0478ef7bef43c513370b8245bafee4d453f0473a4ea2e78557e0b55f35f0e393","observation_id":"3c25cab0-d1df-4c0d-ba57-e46784793316","resolution":{"observed_at":"2026-08-06T20:00:43.760372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T20:00:43.762921Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.762921Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:068b0aa5d57c0d57b001aca31ce433de3e0f7b3479226fd7d633a510d44429de","observation_id":"de0c69b2-4382-4233-89f0-9de5342b9841","resolution":{"observed_at":"2026-08-06T20:00:43.762921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-06T20:00:43.765257Z","title":"Roberta: A robustly optimized bert pretraining approach","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.765257Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:ee778f622ced68553d4096b2414f596ed113d67ee04b08529b913caf12c70849","observation_id":"d8782dc3-b5b3-4034-9a68-35282f763bf8","resolution":{"observed_at":"2026-08-06T20:00:43.765257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:00:44.161332Z","title":"The llama 4 herd: The beginning of a new era of natively multimodal ai innovation","venue":null,"work_id":"a301844a-6c0f-4825-8d7e-887d66dfa2e1","year":2025},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.767832Z"},"links":{"citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:420a8c4e671e34c521af714b626a15c0f66130283df21d63d8878d0db7ddaab8","observation_id":"b6061d93-4618-4fd5-acb7-9e2488a55b30","resolution":{"observed_at":"2026-08-06T20:00:44.164430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.02867","last_updated":"2018-07-28T06:51:27Z","snapshot_observed_at":"2026-08-14T02:17:13.744267Z","submitted_at":"2018-05-08T07:34:17Z","title":"Online normalizer calculation for softmax","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.02867","snapshot_observed_at":"2026-08-06T20:00:43.770365Z","title":"Online normalizer calculation for softmax, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.770365Z"},"links":{"cited_paper":"/paper/1805.02867","citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:3a4e34c1708d0f152abcac24263c9d1ceb94a9cfcaaf02985a3b6643e11b6cb6","observation_id":"c3240aa8-5915-4fab-9f71-a40db2c9b1cb","resolution":{"observed_at":"2026-08-06T20:00:43.770365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:00:44.151409Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":"fd40bc74-0c6a-40d8-b84c-f99f861f0d81","year":2019},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.772867Z"},"links":{"citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:8d18081ee802ced1b3cde6ceaf4d50dda25e5c6b14f645a4905b6b5ec934bd4b","observation_id":"e3d4861c-6c2f-44bd-9932-87ae3957b2c2","resolution":{"observed_at":"2026-08-06T20:00:44.155385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-08-14T04:57:43.972237Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-06T20:00:43.775305Z","title":"Wind, Stanislaw Wozniak, Ruichong Zhang, Zhenyuan Zhang, Qihang Zhao, Peng Zhou, Qinghua Zhou, Jian Zhu, and Rui-Jie Zhu","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.775305Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:57d74155097f8ca9d443be8dd22bdde4e21ee4e28e19c1284e12722aeb5ffe0c","observation_id":"b3c052ec-0b0d-41c1-80d9-bd0172dfd71a","resolution":{"observed_at":"2026-08-06T20:00:43.775305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.12409","last_updated":"2022-04-22T18:20:48Z","snapshot_observed_at":"2026-08-07T11:26:24.970964Z","submitted_at":"2021-08-27T17:35:06Z","title":"Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.12409","snapshot_observed_at":"2026-08-06T20:00:43.778200Z","title":"Train short, test long: Attention with linear biases enables input length extrapolation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.778200Z"},"links":{"cited_paper":"/paper/2108.12409","citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:80e481333262d1b7e2783dbd00b2347ca1a6c62c9573ad672bab1055a0772e66","observation_id":"9433799e-932c-4fac-b92e-dc7f46555db0","resolution":{"observed_at":"2026-08-06T20:00:43.778200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:00:43.780672Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.780672Z"},"links":{"citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:5a784b8d240429083c4b507e59d366ef07a649705dcd4c72bb4313d75ba49712","observation_id":"4f13f900-6f37-4d09-870f-507fb57f35ae","resolution":{"observed_at":"2026-08-06T20:00:43.780672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04431","last_updated":"2025-01-22T01:18:51Z","snapshot_observed_at":"2026-08-12T22:49:48.434250Z","submitted_at":"2024-09-06T17:53:26Z","title":"Theory, Analysis, and Best Practices for Sigmoid Self-Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04431","snapshot_observed_at":"2026-08-06T20:00:43.782864Z","title":"Theory, analysis, and best practices for sigmoid self-attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.782864Z"},"links":{"cited_paper":"/paper/2409.04431","citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:bf2713c115857843d4e53fe2baa4fcc7220af71abf5d25749d6e78887e4119ad","observation_id":"ffc2af75-1f8e-4578-b29a-6f39eeb387ac","resolution":{"observed_at":"2026-08-06T20:00:43.782864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:00:43.785494Z","title":"Toolformer: Language models can teach themselves to use tools","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.785494Z"},"links":{"citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:074d735b3a2b819c4be9e05e6ccf50f87d6187c579016f39a9d766cefe729c80","observation_id":"8917eb8b-dad2-4e79-8653-4f34866760de","resolution":{"observed_at":"2026-08-06T20:00:43.785494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.11174","last_updated":"2021-06-09T14:47:46Z","snapshot_observed_at":"2026-07-06T10:43:36.832191Z","submitted_at":"2021-02-22T16:51:38Z","title":"Linear Transformers Are Secretly Fast Weight Programmers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.11174","snapshot_observed_at":"2026-08-06T20:00:43.787796Z","title":"Linear transformers are secretly fast weight programmers, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.787796Z"},"links":{"cited_paper":"/paper/2102.11174","citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:87864036a4954c977fcc03535437c5c53a877a4521617e1aebb0861fe1b67164","observation_id":"cc5957b9-fae7-4ad7-9188-88264c360130","resolution":{"observed_at":"2026-08-06T20:00:43.787796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-06T20:00:43.790462Z","title":"Fast transformer decoding: One write-head is all you need","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.790462Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:7b4ebd6d2567e187230b4ce562e3dd40861d9a718d63cb748b5f0411b7e1e382","observation_id":"340a5dad-f0ea-4d3d-8b60-55d04d75727c","resolution":{"observed_at":"2026-08-06T20:00:43.790462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-08-13T11:35:07.866136Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-06T20:00:43.792979Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.792979Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:191539a1484d15542e24d1b5f7f3adc852be6abd7cebc9e0748975bf141441ba","observation_id":"99fa56f1-5187-4570-87fb-3d771cdb7fcd","resolution":{"observed_at":"2026-08-06T20:00:43.792979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:00:43.795421Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.795421Z"},"links":{"citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:bfa69f812214272be16eb3fde0d4444744c274f50ccba1434b3d26426884718e","observation_id":"31b0ec1e-54f6-4a0e-b189-af035fd6a35f","resolution":{"observed_at":"2026-08-06T20:00:43.795421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-06T20:00:43.797989Z","title":"Retentive network: A successor to transformer for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.797989Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:11859af82770c2ecb7213f2e6fc65be9c0d90b5b50372df07f61554318badb73","observation_id":"271a02ea-2e44-48e7-b63a-15cb5c0ef046","resolution":{"observed_at":"2026-08-06T20:00:43.797989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:00:44.127332Z","title":"Triton: an intermediate language and compiler for tiled neural network computations","venue":null,"work_id":"f558b0ad-ee8c-4343-a180-f4918ddb0fc0","year":2019},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.800486Z"},"links":{"citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:b9c951c861bdd4f94b7b19ccc13fae060ee6424cb0f8ac8e90b68bbd183c884a","observation_id":"a090348f-fb49-4bf1-b2fe-8c8226c7b231","resolution":{"observed_at":"2026-08-06T20:00:44.130419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-06T20:00:43.802813Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.802813Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:8d66cf055a9daf85da117bd4bd7758f59c2ddc7b524c66d7cbc88fb4242fcb0a","observation_id":"5ce6fe30-dd38-4ab1-9ac0-c52e11ed2101","resolution":{"observed_at":"2026-08-06T20:00:43.802813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:00:44.118061Z","title":"Deep neural network based low-latency speech separation with asymmetric analysis-synthesis window pair","venue":null,"work_id":"403e0d17-6e93-41ba-9ad3-b4f550308c31","year":2021},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.805156Z"},"links":{"citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:6c5a6c7121482f8dc2e9058716473b702a8507eea11c3ce598cb4bc1b2f17f15","observation_id":"c7f95000-2018-4ad4-976e-9ed195be53c4","resolution":{"observed_at":"2026-08-06T20:00:44.121345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:00:43.807571Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.807571Z"},"links":{"citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:b032827bcbf17dd7efc925c82826346f6383b580854530f97c4ee9bf12193ffb","observation_id":"01cf6309-4cfe-4ee4-aa35-ff0de4a903c9","resolution":{"observed_at":"2026-08-06T20:00:43.807571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:00:43.809995Z","title":"Swe-agent: Agent-computer interfaces enable automated software engineering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.809995Z"},"links":{"citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:b5e8f18a35b6b4a097367ae2dfbee805ebb93f229a52d9fe4fc3dd417646870f","observation_id":"d4c99c64-0170-4b19-822c-e4d807b1f218","resolution":{"observed_at":"2026-08-06T20:00:43.809995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:00:44.097938Z","title":"FLA: A Triton-Based Library for Hardware-Efficient Implementations of Linear Attention Mechanism , January 2024","venue":null,"work_id":"e9c17c66-c0d1-42b1-9bc4-35c57cd67231","year":2024},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.812248Z"},"links":{"citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:b4f243a072c869f273d17e3ac421106bf616c404ca95b0e8d3103c11c66ebb35","observation_id":"e780f477-85c6-49b7-b086-b402b9413383","resolution":{"observed_at":"2026-08-06T20:00:44.101560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06635","last_updated":"2024-08-27T01:27:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-11T18:51:59Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06635","snapshot_observed_at":"2026-08-06T20:00:43.814522Z","title":"Gated linear attention transformers with hardware-efficient training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.814522Z"},"links":{"cited_paper":"/paper/2312.06635","citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:be3f782e402d1bb05cb12b5984509061063ecafff471edadcda1bde822538c8a","observation_id":"52bdd85c-618a-4463-b95f-51a7ae527cbe","resolution":{"observed_at":"2026-08-06T20:00:43.814522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06464","last_updated":"2025-03-06T06:57:34Z","snapshot_observed_at":"2026-08-13T23:51:28.504752Z","submitted_at":"2024-12-09T13:09:04Z","title":"Gated Delta Networks: Improving Mamba2 with Delta Rule","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06464","snapshot_observed_at":"2026-08-06T20:00:43.817075Z","title":"Gated delta networks: Improving mamba2 with delta rule, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.817075Z"},"links":{"cited_paper":"/paper/2412.06464","citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:2eab0cb1c4b32a5ce8357594519cf2652a4ee5be91cd28141785a63dc0a6d0f5","observation_id":"1fb8bbf4-257c-4440-a4e7-8e26f39e5bfc","resolution":{"observed_at":"2026-08-06T20:00:43.817075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:00:44.086832Z","title":"Gated slot attention for efficient linear-time sequence modeling","venue":null,"work_id":"8886be05-2a11-4c7a-94e9-7a882ae857c1","year":2024},"citing_paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:43.819726Z"},"links":{"citing_paper":"/paper/2507.04239"},"observation_digest":"sha256:a691ba927fffc3a875515ef7b7963d52887addcce05188c97c3e9e0e1cb1e69b","observation_id":"6231b891-067a-4b46-bc12-2ac6d91a719a","resolution":{"observed_at":"2026-08-06T20:00:44.091757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.04239","last_updated":"2025-07-06T04:15:34Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T23:49:22.098595Z","submitted_at":"2025-07-06T04:15:34Z","title":"Scaling Context Requires Rethinking Attention"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 2 inbound Pith citation observations for arXiv:2507.04239."}