{"as_of":"2026-08-08T04:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f5e22978822cc0b8596642feb8947b8f93262c29bbc9cdfae1832d72c03d9ae7","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T10:32:06.482595Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.20214/citation-record","integrity":"/paper/2607.20214/integrity","json":"/paper/2607.20214/citation-record.json","paper":"/paper/2607.20214"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:03.174044Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:03.174044Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:6cead1c3b6a6252c5d8bfd87dea25097a6903b5b61e8505be7895bb808a25c9c","observation_id":"f2386326-d0ba-4726-a241-6f8e462372f8","resolution":{"observed_at":"2026-08-01T10:32:03.174044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:03.248117Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:03.248117Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:f1fdd0b69466c83e1b5119adcbc392cca42b1c4ff6e01cc68bdd1da9fb32e317","observation_id":"a57e2c03-f0e1-4cdb-ae6f-b5a2a738fdb6","resolution":{"observed_at":"2026-08-01T10:32:03.248117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:03.338791Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:03.338791Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:eb0cf1b3bc8f4d2e04151971ea36ad0c089edea45e04fbbfaff9e0eb22527d2d","observation_id":"d1a0e1aa-e3be-4667-8b72-10caf507bacf","resolution":{"observed_at":"2026-08-01T10:32:03.338791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:03.458649Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:03.458649Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:655254cd0a45908136a35f625ef0ef289c1932bd1a858aefa94658fedd72bad5","observation_id":"792e0277-ce1a-4aa2-8c6f-2fa4259d1ae5","resolution":{"observed_at":"2026-08-01T10:32:03.458649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-01T10:32:03.568261Z","title":"arXiv preprint arXiv:2302.13971 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:03.568261Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:bc3c91125ac52ae22a76ab4d8731550c47346dae77feaaa546cdb03bf209c7d5","observation_id":"d5a379ad-7213-44c9-b700-9f8ba08c8911","resolution":{"observed_at":"2026-08-01T10:32:03.568261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:03.653012Z","title":"and Ermon, Stefano and Rudra, Atri and R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:03.653012Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:45b0295dc1c40a3a702333c8412b582db2c869e711380121671cee7dbb334632","observation_id":"304d326e-f7c3-49b4-aa93-fc09c0dda553","resolution":{"observed_at":"2026-08-01T10:32:03.653012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-01T10:32:03.722461Z","title":"arXiv preprint arXiv:2307.08691 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:03.722461Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:d6ffebddb4005f58e8ef22e2d193cc0deb8b24960fc1817fa58cbff307c5962d","observation_id":"2222f6ce-efbc-420d-a4a7-3ee00c44cca5","resolution":{"observed_at":"2026-08-01T10:32:03.722461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-06T08:05:35.311510Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-01T10:32:03.789040Z","title":"arXiv preprint arXiv:1904.10509 , year=","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:03.789040Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:64bc3db9eb2071b066123f905bcde026497dda57d7d207bf31922c890e6b29bd","observation_id":"46e1316b-dbfb-47d7-a57a-a0faddd2fe45","resolution":{"observed_at":"2026-08-01T10:32:03.789040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-01T10:32:03.863529Z","title":"arXiv preprint arXiv:2004.05150 , year=","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:03.863529Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:815eeccfd0318619beb13a0066d18f86c67558f20891ea59d3c1f38602c2daba","observation_id":"bb86d545-6f8d-41a5-bd9d-6108a4ee656d","resolution":{"observed_at":"2026-08-01T10:32:03.863529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:03.946570Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:03.946570Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:6042c1610c2c5a1c1ddfcc8772afe13b45b4c24dce2c0e55409a96a9b7497382","observation_id":"57c2936f-b0ab-4496-9751-3d686217856e","resolution":{"observed_at":"2026-08-01T10:32:03.946570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:04.026336Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:04.026336Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:28dc49d57b839d7b3e89cf9c0dfc3139ac0daf8fda83acbc2b8a04b93f566c0d","observation_id":"0c936693-3a75-4612-a334-bdbd97b6659c","resolution":{"observed_at":"2026-08-01T10:32:04.026336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:04.076816Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:04.076816Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:530fcf46ec773fcc930db6e3b54416c005ca36403ac128f8bb993ed54baa4a68","observation_id":"08bbb57f-43a6-4ed8-9875-460c942f739a","resolution":{"observed_at":"2026-08-01T10:32:04.076816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:04.169291Z","title":", journal=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:04.169291Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:47d54b86f44d8cb2b46869a2b2ac491c4394b7659cdd40f15f16a3de0d7b7254","observation_id":"cf254f11-37fb-4012-9b70-e96f069ea1d2","resolution":{"observed_at":"2026-08-01T10:32:04.169291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-08-01T10:32:04.226276Z","title":"arXiv preprint arXiv:2006.04768 , year=","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:04.226276Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:940c95d0ee14c73a74ffa86edc018d965b6dfcac224afe66f1344c17074c51a5","observation_id":"d8f2b60a-7523-4601-949a-e0b30416d829","resolution":{"observed_at":"2026-08-01T10:32:04.226276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:04.312658Z","title":"Transformers are","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:04.312658Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:c74d366ffd834ab0cb1925b79db9e9c361726871d1e3bac55ec2a44710732df5","observation_id":"de48ab99-abb4-4d16-bb85-747e0744657c","resolution":{"observed_at":"2026-08-01T10:32:04.312658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:04.371726Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:04.371726Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:0f036c0297e88b0d994f57a3ed03988042883da65652f25e9f973b8f8d1781b7","observation_id":"071f3523-8bfa-4dc4-9d4f-ddbb3ed24dcb","resolution":{"observed_at":"2026-08-01T10:32:04.371726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:04.456446Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:04.456446Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:72d005fd945391c32899dfd54836f063a24874622a397ecb7d1a41b90418690c","observation_id":"58c6c581-a104-4fb5-907c-d63a33b8963a","resolution":{"observed_at":"2026-08-01T10:32:04.456446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:04.551012Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:04.551012Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:593d16814bf54c27f05eba184160206869223ceba2d70c23eec6e96f94e377fa","observation_id":"89088e31-efa1-4264-ad12-6dbffd28cfcb","resolution":{"observed_at":"2026-08-01T10:32:04.551012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:04.630979Z","title":"2026 , url=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:04.630979Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:a5047c99863d996d0a574c94714844d7f614a53cb80ea0bb209c7d9ad70c9ca1","observation_id":"fe80ecdf-fd2b-44b1-a5c8-6ee6aa7b317f","resolution":{"observed_at":"2026-08-01T10:32:04.630979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.04006","last_updated":"2020-11-08T15:53:56Z","snapshot_observed_at":"2026-07-06T10:12:38.348940Z","submitted_at":"2020-11-08T15:53:56Z","title":"Long Range Arena: A Benchmark for Efficient Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.04006","snapshot_observed_at":"2026-08-01T10:32:04.694241Z","title":"arXiv preprint arXiv:2011.04006 , year=","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:04.694241Z"},"links":{"cited_paper":"/paper/2011.04006","citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:a05c0ca7f639fb9d2bc9362fc0f50b4d9d65d4bc03d3c408d631a58851a7b07b","observation_id":"09dc09e6-a5a9-4bc2-b362-1dfba00172cf","resolution":{"observed_at":"2026-08-01T10:32:04.694241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:04.774621Z","title":"ACM Computing Surveys , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:04.774621Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:6a0a96322392fe27e414a29166014260d7587b7edc8c977074ec5ee3958b313b","observation_id":"08edee9a-fa1e-41c1-9cfd-ccefd8d3f6d4","resolution":{"observed_at":"2026-08-01T10:32:04.774621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:04.836675Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:04.836675Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:f5f101467efc8a0b5b868521861cfc48725cc11adfd6d76986aa3e8afa0f49c4","observation_id":"0597e20f-5870-4002-ac2f-fc174fa746e1","resolution":{"observed_at":"2026-08-01T10:32:04.836675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:04.898264Z","title":"Journal of the ACM , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:04.898264Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:7a1f3d99fe1ad875431b9819c4eb18af21b32b89d9a0ce2d40392c965c5bab31","observation_id":"6582d19c-aa01-4a02-b9b9-aad9d92e6258","resolution":{"observed_at":"2026-08-01T10:32:04.898264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:04.966941Z","title":"SIAM Journal on Optimization , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:04.966941Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:e1ea9eff6e6b2215a08076d9b6972ce66bd8a7ae70cf6b2c944d5895ac3dde7d","observation_id":"53acde4d-0d23-4dfc-a1f0-f896f11c4667","resolution":{"observed_at":"2026-08-01T10:32:04.966941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:05.030880Z","title":"and Shen, Yelong and Wallis, Phillip and Allen-Zhu, Zeyuan and Li, Yuanzhi and Wang, Shean and Wang, Lu and Chen, Weizhu , booktitle=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:05.030880Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:9c8315dd75eafac1a41a56a2483aad56121aa498d2d53356029803a31bd74845","observation_id":"ec281921-eccc-494a-99a2-8e00e4119f37","resolution":{"observed_at":"2026-08-01T10:32:05.030880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13569","last_updated":"2022-09-27T17:43:45Z","snapshot_observed_at":"2026-08-07T03:29:16.217842Z","submitted_at":"2022-09-27T17:43:45Z","title":"Exploring Low Rank Training of Deep Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13569","snapshot_observed_at":"2026-08-01T10:32:05.111960Z","title":"arXiv preprint arXiv:2209.13569 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:05.111960Z"},"links":{"cited_paper":"/paper/2209.13569","citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:c672b820200bff3ebb8420da8378c523ecec555bdbaf1a7bb51244e6f0054de6","observation_id":"04b04466-f7ad-47d0-8bad-9df2bafa4b32","resolution":{"observed_at":"2026-08-01T10:32:05.111960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:05.171902Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:05.171902Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:3a81967856e98a973ea1e1971680384c86519cbfbd9c3cc326b1a96dffa099de","observation_id":"0d84977c-0da4-46c3-b011-aae388d0b3f8","resolution":{"observed_at":"2026-08-01T10:32:05.171902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:05.267313Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:05.267313Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:c38f33591be3634a738d13c8f1c0cadde4f73270da2bc2e017769b5a8ee277bc","observation_id":"481f74eb-165b-45f1-bebb-6aba7c61eb3c","resolution":{"observed_at":"2026-08-01T10:32:05.267313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:05.321547Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:05.321547Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:51d356ff4cf00d8095250766f15e7d9dfbeab4474532252a909478cb30195ee2","observation_id":"5955f48f-3cdf-42df-a6b9-b442a2c76806","resolution":{"observed_at":"2026-08-01T10:32:05.321547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:05.405303Z","title":"Advances in Neural Information Processing Systems , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:05.405303Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:7d58a3fc7efa6ebb30ea0c2445f1b756ebbb27f18095bafc316d900cce5e5cab","observation_id":"4ec3404b-1213-4ffd-a4e5-0228f44f470d","resolution":{"observed_at":"2026-08-01T10:32:05.405303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:05.461772Z","title":"2024 , eprint =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:05.461772Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:61e171ba7ab08f7498f8889c1d380423b018c73b92a052fb10b964d0c1178948","observation_id":"92178cd2-2889-477e-96ce-aef2b6b9878f","resolution":{"observed_at":"2026-08-01T10:32:05.461772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:05.508368Z","title":"2024 , publisher =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:05.508368Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:6ffbebf8b3908b6d1bce1e260146e30fe8601711fd9961cdf5631bf4e20355b5","observation_id":"57bde0c9-5ef0-470e-9dc8-8fda511f06f0","resolution":{"observed_at":"2026-08-01T10:32:05.508368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:05.557899Z","title":"and Li, Dongsheng and Lin, Chin-Yew and Yang, Yuqing and Qiu, Lili , booktitle =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:05.557899Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:9b7f05120284ff534f5c777de275b3a2304cb2d2b1ff4f7153eb430ff3486a89","observation_id":"9eece39f-7468-4cdb-b686-ce195d496009","resolution":{"observed_at":"2026-08-01T10:32:05.557899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:05.639334Z","title":"2023 , publisher =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:05.639334Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:1544fbacb331fb825b9a3dc914e08a187de5e7b43c7756313d9f416a4ca95a98","observation_id":"38ddc183-5718-47a3-a603-6afc048a6e41","resolution":{"observed_at":"2026-08-01T10:32:05.639334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16325","last_updated":"2025-01-25T22:24:04Z","snapshot_observed_at":"2026-08-01T16:02:13.326628Z","submitted_at":"2024-05-25T18:43:05Z","title":"SLoPe: Double-Pruned Sparse Plus Lazy Low-Rank Adapter Pretraining of LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16325","snapshot_observed_at":"2026-08-01T10:32:05.695707Z","title":"2405.16325 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:05.695707Z"},"links":{"cited_paper":"/paper/2405.16325","citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:da3b62fe953d229dda9efa309213db0fb9b4e485d858c805265704361a0bd3de","observation_id":"c1eb0afa-b30c-49bd-b6dd-754ccc0131fa","resolution":{"observed_at":"2026-08-01T10:32:05.695707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:05.741152Z","title":"Proceedings of the 49th Annual Meeting of the Association for Computational Linguistics , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:05.741152Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:8c3da9464021c97492a32f04f193b70bafc87f5cced2929bea01359fd08ace25","observation_id":"c745175a-8bb7-434f-942b-fad0ecafc5de","resolution":{"observed_at":"2026-08-01T10:32:05.741152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:05.793324Z","title":"European Conference on Computer Vision (ECCV) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:05.793324Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:8d1f7cec306e0131f4617cfe0ae2e34138d57548fedf4cb8b5c2b94f91f36920","observation_id":"42ae099a-7178-431d-a5fd-e4c72e06db10","resolution":{"observed_at":"2026-08-01T10:32:05.793324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.07747","last_updated":"2017-09-15T21:29:49Z","snapshot_observed_at":"2026-07-06T05:56:41.814255Z","submitted_at":"2017-08-25T14:01:29Z","title":"Fashion-MNIST: a Novel Image Dataset for Benchmarking Machine Learning Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.07747","snapshot_observed_at":"2026-08-01T10:32:05.844201Z","title":"arXiv preprint arXiv:1708.07747 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:05.844201Z"},"links":{"cited_paper":"/paper/1708.07747","citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:d262ce70f92e68bb76cc7fef3b37084c0237362d79e8d788c6a450ffd1c5407c","observation_id":"04812f29-a30a-4d80-858a-aadd3033d12f","resolution":{"observed_at":"2026-08-01T10:32:05.844201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:05.909473Z","title":"Proceedings of the Indian Conference on Computer Vision, Graphics and Image Processing , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:05.909473Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:3f8c6970d355290d19e1fa9bbca68bb1c2f55fe94cbb93b4ba431f310c217f78","observation_id":"ccd33754-2d96-4105-9f55-be8fe7a577ed","resolution":{"observed_at":"2026-08-01T10:32:05.909473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:05.988166Z","title":"IEEE Conference on Computer Vision and Pattern Recognition (CVPR) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:05.988166Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:eda8d76810d343590aeef8a061b1c2e47bc5af7f212051b9a5911473f684cbbf","observation_id":"b7a4aabb-6754-43e1-b46a-b6442856f85f","resolution":{"observed_at":"2026-08-01T10:32:05.988166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:06.026103Z","title":"arXiv preprint arXiv:2401.XXXX , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:06.026103Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:4078f21c83716715f54b40875a9c032befb5a8a9b5af9d189fb935c9d5d6571e","observation_id":"ab02ad10-5ab7-4e46-b193-cfb5e5962209","resolution":{"observed_at":"2026-08-01T10:32:06.026103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:06.112197Z","title":"2023 , publisher=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:06.112197Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:e6326c94686e3867522d754ae5376534d8a3c27f617653a82ff13c13e241f77f","observation_id":"6f2857e7-a857-4688-911a-b3f1915a9dc1","resolution":{"observed_at":"2026-08-01T10:32:06.112197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:06.242028Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:06.242028Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:671fb4cf67d2e861624aab89ea84f88fa7fba46264721ac2c62ea64269222a84","observation_id":"25eaf955-bd09-40fe-9474-d2e8f6b6bca7","resolution":{"observed_at":"2026-08-01T10:32:06.242028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:06.340957Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:06.340957Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:066abcd50278983d6cc59132b4f76dfbffe178256bd2891c6689b7213a15e1d9","observation_id":"59582d41-f65b-42cb-bd30-1933e6b6a49d","resolution":{"observed_at":"2026-08-01T10:32:06.340957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:32:06.482595Z","title":"2023 , eprint =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T10:32:06.482595Z"},"links":{"citing_paper":"/paper/2607.20214"},"observation_digest":"sha256:351d74ace9f0a40db3423f491a8a35e67f406b4bdfd5cc49f0ebd819d3c52d12","observation_id":"1171c431-d196-4cf7-b483-9cb3cfa84fc8","resolution":{"observed_at":"2026-08-01T10:32:06.482595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.20214","last_updated":"2026-07-22T14:34:49Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-04T02:55:48.595796Z","submitted_at":"2026-07-22T14:34:49Z","title":"ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2607.20214."}