{"as_of":"2026-08-08T14:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bc2ffaa42803c5909efb77c8652e038e1c7e6a0c46bd2109f5c9f152437b33d5","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:19:59.124623Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.08637/citation-record","integrity":"/paper/2507.08637/integrity","json":"/paper/2507.08637/citation-record.json","paper":"/paper/2507.08637"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.422368Z","title":null,"venue":null,"work_id":"b0780b43-6987-4ad2-b118-ff6d8814fc1a","year":2021},"citing_paper":{"arxiv_id":"2507.08637","last_updated":"2025-07-11T14:40:40Z","snapshot_observed_at":"2026-08-06T18:11:30.264997Z","submitted_at":"2025-07-11T14:40:40Z","title":"Scaling Attention to Very Long Sequences in Linear Time with Wavelet-Enhanced Random Spectral Attention (WERSA)","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.120424Z"},"links":{"citing_paper":"/paper/2507.08637"},"observation_digest":"sha256:da4b12fd1c36417478e370730e3f357eea34bfac1595bb7e4a0f089fe2419d79","observation_id":"fd8dd414-dd24-4ab0-97ee-9560488ff616","resolution":{"observed_at":"2026-08-06T18:19:59.425992Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.00075","last_updated":"2019-04-30T19:43:53Z","snapshot_observed_at":"2026-07-06T07:49:38.806531Z","submitted_at":"2019-04-30T19:43:53Z","title":"On the Use of ArXiv as a Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.00075","snapshot_observed_at":"2026-08-06T18:19:59.002779Z","title":"On the use of arxiv as a dataset","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2507.08637","last_updated":"2025-07-11T14:40:40Z","snapshot_observed_at":"2026-08-06T18:11:30.264997Z","submitted_at":"2025-07-11T14:40:40Z","title":"Scaling Attention to Very Long Sequences in Linear Time with Wavelet-Enhanced Random Spectral Attention (WERSA)","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.002779Z"},"links":{"cited_paper":"/paper/1905.00075","citing_paper":"/paper/2507.08637"},"observation_digest":"sha256:cd92dc9e0fc90c7a82cc9220e02f3389a06ff8d27ec612ffa42ec5ce4a24ba33","observation_id":"a081d3e3-d084-4854-b1c2-170057c786fb","resolution":{"observed_at":"2026-08-06T18:19:59.002779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.02860","last_updated":"2019-06-02T21:21:48Z","snapshot_observed_at":"2026-07-06T07:25:48.468658Z","submitted_at":"2019-01-09T18:28:19Z","title":"Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.02860","snapshot_observed_at":"2026-08-06T18:19:59.026663Z","title":"T Dao, D","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.08637","last_updated":"2025-07-11T14:40:40Z","snapshot_observed_at":"2026-08-06T18:11:30.264997Z","submitted_at":"2025-07-11T14:40:40Z","title":"Scaling Attention to Very Long Sequences in Linear Time with Wavelet-Enhanced Random Spectral Attention (WERSA)","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.026663Z"},"links":{"cited_paper":"/paper/1901.02860","citing_paper":"/paper/2507.08637"},"observation_digest":"sha256:654635b20fdb849c18a04df027669eaff8935520db674aeb031b4e8c10de28dd","observation_id":"109a4e65-e163-46fb-aa3f-825e0a6d4ab8","resolution":{"observed_at":"2026-08-06T18:19:59.026663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-06T18:19:59.030523Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08637","last_updated":"2025-07-11T14:40:40Z","snapshot_observed_at":"2026-08-06T18:11:30.264997Z","submitted_at":"2025-07-11T14:40:40Z","title":"Scaling Attention to Very Long Sequences in Linear Time with Wavelet-Enhanced Random Spectral Attention (WERSA)","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.030523Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2507.08637"},"observation_digest":"sha256:2331bd4653b345693e76f23cb30d5edcaefb03d6ff4024977817d1ff6871acb8","observation_id":"7c854729-b3e7-41cf-982e-9683292a4243","resolution":{"observed_at":"2026-08-06T18:19:59.030523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T18:19:59.039722Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.08637","last_updated":"2025-07-11T14:40:40Z","snapshot_observed_at":"2026-08-06T18:11:30.264997Z","submitted_at":"2025-07-11T14:40:40Z","title":"Scaling Attention to Very Long Sequences in Linear Time with Wavelet-Enhanced Random Spectral Attention (WERSA)","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.039722Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.08637"},"observation_digest":"sha256:2d6b675cd02feffbc9d937ed5e9e0e32d3c537331f06005df8e5b26ea14206a0","observation_id":"5e5daeec-0946-4337-a372-26d9a9fed0fc","resolution":{"observed_at":"2026-08-06T18:19:59.039722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00396","last_updated":"2022-08-05T17:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-31T03:32:18Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00396","snapshot_observed_at":"2026-08-06T18:19:59.055602Z","title":"Angelos Katharopoulos, Apoorv Vyas, Nikolaos Pappas, and François Fleuret","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08637","last_updated":"2025-07-11T14:40:40Z","snapshot_observed_at":"2026-08-06T18:11:30.264997Z","submitted_at":"2025-07-11T14:40:40Z","title":"Scaling Attention to Very Long Sequences in Linear Time with Wavelet-Enhanced Random Spectral Attention (WERSA)","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.055602Z"},"links":{"cited_paper":"/paper/2111.00396","citing_paper":"/paper/2507.08637"},"observation_digest":"sha256:6803591734113d5655c3a21cc9766373b051bfc3844d78d2868009b65b2c0a18","observation_id":"c5daa5ea-e5a2-4432-8753-c109029e39dd","resolution":{"observed_at":"2026-08-06T18:19:59.055602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10655","last_updated":"2023-01-28T06:33:20Z","snapshot_observed_at":"2026-08-07T01:23:02.071264Z","submitted_at":"2022-09-21T20:52:17Z","title":"Mega: Moving Average Equipped Gated Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.10655","snapshot_observed_at":"2026-08-06T18:19:59.066945Z","title":"Mega: Moving average equipped gated attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08637","last_updated":"2025-07-11T14:40:40Z","snapshot_observed_at":"2026-08-06T18:11:30.264997Z","submitted_at":"2025-07-11T14:40:40Z","title":"Scaling Attention to Very Long Sequences in Linear Time with Wavelet-Enhanced Random Spectral Attention (WERSA)","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.066945Z"},"links":{"cited_paper":"/paper/2209.10655","citing_paper":"/paper/2507.08637"},"observation_digest":"sha256:b8eaf7ced0418da15575dc538d254d615692d0a01dea0987ab409f7d8204b251","observation_id":"2ba0c6f1-76da-44b3-b17b-a3107a7cd05a","resolution":{"observed_at":"2026-08-06T18:19:59.066945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-06T18:19:59.080608Z","title":"Rwkv: Reinventing rnns for the transformer era","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08637","last_updated":"2025-07-11T14:40:40Z","snapshot_observed_at":"2026-08-06T18:11:30.264997Z","submitted_at":"2025-07-11T14:40:40Z","title":"Scaling Attention to Very Long Sequences in Linear Time with Wavelet-Enhanced Random Spectral Attention (WERSA)","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.080608Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2507.08637"},"observation_digest":"sha256:9d1ddcf17d0d470153daf8c104b49e41a06b5f09ae237f69d05d3b9634dfc07c","observation_id":"4682cb19-479f-4f81-9aa7-bd7cfd362be3","resolution":{"observed_at":"2026-08-06T18:19:59.080608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.02143","last_updated":"2021-03-19T21:24:06Z","snapshot_observed_at":"2026-08-04T23:37:38.910806Z","submitted_at":"2021-03-03T02:48:56Z","title":"Random Feature Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.02143","snapshot_observed_at":"2026-08-06T18:19:59.085521Z","title":"Random feature attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08637","last_updated":"2025-07-11T14:40:40Z","snapshot_observed_at":"2026-08-06T18:11:30.264997Z","submitted_at":"2025-07-11T14:40:40Z","title":"Scaling Attention to Very Long Sequences in Linear Time with Wavelet-Enhanced Random Spectral Attention (WERSA)","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.085521Z"},"links":{"cited_paper":"/paper/2103.02143","citing_paper":"/paper/2507.08637"},"observation_digest":"sha256:ea14a228b70c03133b51c8152c2e9ab63f8dbc5e999bfe4eef5886ae3296a50f","observation_id":"892858da-22bc-4cfa-b2b6-4f01e6cb0adf","resolution":{"observed_at":"2026-08-06T18:19:59.085521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-06T18:19:59.088847Z","title":"Compressive transformers for long-range sequence modelling","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2507.08637","last_updated":"2025-07-11T14:40:40Z","snapshot_observed_at":"2026-08-06T18:11:30.264997Z","submitted_at":"2025-07-11T14:40:40Z","title":"Scaling Attention to Very Long Sequences in Linear Time with Wavelet-Enhanced Random Spectral Attention (WERSA)","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.088847Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2507.08637"},"observation_digest":"sha256:e4aca2bdc603b6179ee0cbfb3406fd84c3281737097d533cbb354136f766b0b1","observation_id":"8da21433-da9a-4d10-a229-6a4651f9ca91","resolution":{"observed_at":"2026-08-06T18:19:59.088847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-06T18:19:59.102425Z","title":"S Wang et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08637","last_updated":"2025-07-11T14:40:40Z","snapshot_observed_at":"2026-08-06T18:11:30.264997Z","submitted_at":"2025-07-11T14:40:40Z","title":"Scaling Attention to Very Long Sequences in Linear Time with Wavelet-Enhanced Random Spectral Attention (WERSA)","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.102425Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2507.08637"},"observation_digest":"sha256:9e1ca633c5b54ce2482602b5b27a4e4d214a68d4d94ff719efe0b9cad67d6ece","observation_id":"5c7cea95-11b6-462b-8566-4de0ae71d0e9","resolution":{"observed_at":"2026-08-06T18:19:59.102425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-08-06T18:19:59.106177Z","title":"Y Xiong, Z Zeng, et al","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.08637","last_updated":"2025-07-11T14:40:40Z","snapshot_observed_at":"2026-08-06T18:11:30.264997Z","submitted_at":"2025-07-11T14:40:40Z","title":"Scaling Attention to Very Long Sequences in Linear Time with Wavelet-Enhanced Random Spectral Attention (WERSA)","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.106177Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2507.08637"},"observation_digest":"sha256:94ecd29145676613b66a48560a8cc8e4c3039bdcf42667f501a98f5f80b1e5ab","observation_id":"42f71596-37b0-4ead-bc7a-d3545bbf0d89","resolution":{"observed_at":"2026-08-06T18:19:59.106177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.450907Z","title":"Tian Zhou, Ziqing Ma, Qingsong Wen, Xue Wang, Liang Sun, and Rong Jin","venue":null,"work_id":"4015dea5-45ec-4d2d-89b3-98a71d32f2d3","year":2020},"citing_paper":{"arxiv_id":"2507.08637","last_updated":"2025-07-11T14:40:40Z","snapshot_observed_at":"2026-08-06T18:11:30.264997Z","submitted_at":"2025-07-11T14:40:40Z","title":"Scaling Attention to Very Long Sequences in Linear Time with Wavelet-Enhanced Random Spectral Attention (WERSA)","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.112324Z"},"links":{"citing_paper":"/paper/2507.08637"},"observation_digest":"sha256:6c379000177c401685fa26b41538a9e94c013fa220ae71c5ce7b3f534dd869ae","observation_id":"bf4b19f1-f964-4045-9576-875964532731","resolution":{"observed_at":"2026-08-06T18:19:59.454835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.436283Z","title":null,"venue":null,"work_id":"8ad0d12f-f08a-4f83-ae12-cec6368a5aa0","year":2017},"citing_paper":{"arxiv_id":"2507.08637","last_updated":"2025-07-11T14:40:40Z","snapshot_observed_at":"2026-08-06T18:11:30.264997Z","submitted_at":"2025-07-11T14:40:40Z","title":"Scaling Attention to Very Long Sequences in Linear Time with Wavelet-Enhanced Random Spectral Attention (WERSA)","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.116208Z"},"links":{"citing_paper":"/paper/2507.08637"},"observation_digest":"sha256:4107d56296bbf0cfaa4c2ebb38d09eb0589ac1cb89496cc0588ca48931e0e605","observation_id":"92a9b74e-4d6c-4b38-b474-fc4fc78b8561","resolution":{"observed_at":"2026-08-06T18:19:59.443101Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.406749Z","title":"Here, R ∈ Rd×m has independent and identically distributed Gaussian entries, E ϕ(q)T ϕ(k) − κ(q, k) ≤ C√m , where κ refers to the softmax kernel","venue":null,"work_id":"f39f6c9e-6fd8-4868-9513-e5769b871980","year":1999},"citing_paper":{"arxiv_id":"2507.08637","last_updated":"2025-07-11T14:40:40Z","snapshot_observed_at":"2026-08-06T18:11:30.264997Z","submitted_at":"2025-07-11T14:40:40Z","title":"Scaling Attention to Very Long Sequences in Linear Time with Wavelet-Enhanced Random Spectral Attention (WERSA)","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.124623Z"},"links":{"citing_paper":"/paper/2507.08637"},"observation_digest":"sha256:388ebfed9469e19b745e57e8139708e98b1580a52f58423f9bfd39f89b975130","observation_id":"e9d6b606-b5d2-4735-880d-d1ec74f053fb","resolution":{"observed_at":"2026-08-06T18:19:59.413911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.464260Z","title":null,"venue":null,"work_id":"2d4399d0-7965-46d9-9665-20c61058bc04","year":2018},"citing_paper":{"arxiv_id":"2507.08637","last_updated":"2025-07-11T14:40:40Z","snapshot_observed_at":"2026-08-06T18:11:30.264997Z","submitted_at":"2025-07-11T14:40:40Z","title":"Scaling Attention to Very Long Sequences in Linear Time with Wavelet-Enhanced Random Spectral Attention (WERSA)","version":1},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.075723Z"},"links":{"citing_paper":"/paper/2507.08637"},"observation_digest":"sha256:420139d6104fd522e2b86fd488f04663487fe171c3a375373150ca273f17f143","observation_id":"3d6ca54a-980e-4ec0-b14d-1495f126d14d","resolution":{"observed_at":"2026-08-06T18:19:59.467682Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-06T08:05:35.311510Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-06T18:19:58.997598Z","title":"Krzysztof Choromanski, Valerii Likhosherstov, David Dohan, Xingyou Song, Andreea Gane, Tamas Sarlos, Peter Hawkins, Jared Davis, Afroz Mohiuddin, Lukasz Kaiser, et al","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2507.08637","last_updated":"2025-07-11T14:40:40Z","snapshot_observed_at":"2026-08-06T18:11:30.264997Z","submitted_at":"2025-07-11T14:40:40Z","title":"Scaling Attention to Very Long Sequences in Linear Time with Wavelet-Enhanced Random Spectral Attention (WERSA)","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.997598Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2507.08637"},"observation_digest":"sha256:6befcee2896e388b70d831ef0b87f3daad67402fd14229871fd8e800581fbbe1","observation_id":"cf960b86-006c-4967-81c9-d1efade079cf","resolution":{"observed_at":"2026-08-06T18:19:58.997598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-06T18:19:58.989559Z","title":"T Brown, B Mann, N Ryder, et al","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.08637","last_updated":"2025-07-11T14:40:40Z","snapshot_observed_at":"2026-08-06T18:11:30.264997Z","submitted_at":"2025-07-11T14:40:40Z","title":"Scaling Attention to Very Long Sequences in Linear Time with Wavelet-Enhanced Random Spectral Attention (WERSA)","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.989559Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2507.08637"},"observation_digest":"sha256:d60fd6260a03183fc1fc0fe9cbb9fbb1b05d3fea6bb150879c175be55d31ae74","observation_id":"1cde1ea8-d033-463a-a18e-5d66e60c7560","resolution":{"observed_at":"2026-08-06T18:19:58.989559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.03824","last_updated":"2022-05-26T18:50:20Z","snapshot_observed_at":"2026-08-03T17:35:52.520891Z","submitted_at":"2021-05-09T03:32:48Z","title":"FNet: Mixing Tokens with Fourier Transforms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.03824","snapshot_observed_at":"2026-08-06T18:19:59.062242Z","title":"Zongyi Li, Daniel Zhengyu Huang, Burigede Liu, and Anima Anandkumar","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08637","last_updated":"2025-07-11T14:40:40Z","snapshot_observed_at":"2026-08-06T18:11:30.264997Z","submitted_at":"2025-07-11T14:40:40Z","title":"Scaling Attention to Very Long Sequences in Linear Time with Wavelet-Enhanced Random Spectral Attention (WERSA)","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.062242Z"},"links":{"cited_paper":"/paper/2105.03824","citing_paper":"/paper/2507.08637"},"observation_digest":"sha256:f3c1a77330b4b1691f535c4b917600150a77e6d0d626d4c850980f8a1bf96529","observation_id":"ec2fe666-c143-432c-9d6c-f682d7b3ee8b","resolution":{"observed_at":"2026-08-06T18:19:59.062242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.507781Z","title":"Peter L Bartlett and Shahar Mendelson","venue":null,"work_id":"8c4630b5-5612-48b5-9ba4-5afbd38d5bd1","year":2022},"citing_paper":{"arxiv_id":"2507.08637","last_updated":"2025-07-11T14:40:40Z","snapshot_observed_at":"2026-08-06T18:11:30.264997Z","submitted_at":"2025-07-11T14:40:40Z","title":"Scaling Attention to Very Long Sequences in Linear Time with Wavelet-Enhanced Random Spectral Attention (WERSA)","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.976895Z"},"links":{"citing_paper":"/paper/2507.08637"},"observation_digest":"sha256:a51da609e147f972c6c0f6ac12f048cafd8043a1b2d5135e8196adf8d066e9a1","observation_id":"14bbb4a8-30e5-4edf-bad3-72df948be2a4","resolution":{"observed_at":"2026-08-06T18:19:59.512551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.483882Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":"c7436c29-62e5-4792-8a37-96d44bff5dc7","year":2019},"citing_paper":{"arxiv_id":"2507.08637","last_updated":"2025-07-11T14:40:40Z","snapshot_observed_at":"2026-08-06T18:11:30.264997Z","submitted_at":"2025-07-11T14:40:40Z","title":"Scaling Attention to Very Long Sequences in Linear Time with Wavelet-Enhanced Random Spectral Attention (WERSA)","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.035017Z"},"links":{"citing_paper":"/paper/2507.08637"},"observation_digest":"sha256:ff8c2debdf29fc61bb37ecebd3f6deff3c2ce42e6e7ae4c7c55fe53f688b0282","observation_id":"9ae1559d-846f-472c-85b1-5fd428862434","resolution":{"observed_at":"2026-08-06T18:19:59.489106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00805","last_updated":"2018-08-21T00:02:44Z","snapshot_observed_at":"2026-07-06T05:36:24.195368Z","submitted_at":"2017-04-03T20:50:29Z","title":"On the Properties of the Softmax Function with Application in Game Theory and Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00805","snapshot_observed_at":"2026-08-06T18:19:59.044342Z","title":"On the properties of the softmax function with application in game theory and reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08637","last_updated":"2025-07-11T14:40:40Z","snapshot_observed_at":"2026-08-06T18:11:30.264997Z","submitted_at":"2025-07-11T14:40:40Z","title":"Scaling Attention to Very Long Sequences in Linear Time with Wavelet-Enhanced Random Spectral Attention (WERSA)","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.044342Z"},"links":{"cited_paper":"/paper/1704.00805","citing_paper":"/paper/2507.08637"},"observation_digest":"sha256:139b337c002f62aa2ba534a2399b3b5d1b9c0504e71305c98a5bb4e1db3174c6","observation_id":"45f548ce-8e1f-4ee9-8e50-e8e145103771","resolution":{"observed_at":"2026-08-06T18:19:59.044342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.08637","last_updated":"2025-07-11T14:40:40Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T18:11:30.264997Z","submitted_at":"2025-07-11T14:40:40Z","title":"Scaling Attention to Very Long Sequences in Linear Time with Wavelet-Enhanced Random Spectral Attention (WERSA)"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2507.08637."}