{"as_of":"2026-08-08T09:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1641bb26f82864dae05c132494ab1667caef5cd82655770ea1f54ef2d9f03dfc","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T12:54:36.489014Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2510.01718/citation-record","integrity":"/paper/2510.01718/integrity","json":"/paper/2510.01718/citation-record.json","paper":"/paper/2510.01718"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:30.229619Z","title":"Croci, Marcelo Gennari do Nascimento, Torsten Hoefler, and James Hensman","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:30.229619Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:48f65f28ea937664a78fdbbce18c6cadfdb37956ffa92f79a5a98ce3c2a95515","observation_id":"73142ff2-4f01-4393-9534-36de299848ad","resolution":{"observed_at":"2026-08-04T12:54:30.229619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-04T12:54:30.269838Z","title":"Longformer: The long-document transformer","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:30.269838Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:b8d3ac28e95fa9876820a4a5744818d86b87bb88ff70e98e688ecc534ff5fde2","observation_id":"640eeb3a-151f-454f-9f2f-4da6f2fa88f4","resolution":{"observed_at":"2026-08-04T12:54:30.269838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-04T12:54:30.322033Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:30.322033Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:ad06d1e2eca2d210b134855609a5bc98d5e32645ba441b6f2b956fe13a78e7ec","observation_id":"a7045ed7-be93-4994-92ba-59ddb6e45bc7","resolution":{"observed_at":"2026-08-04T12:54:30.322033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:30.370688Z","title":"Linear least squares solutions by householder transformations","venue":null,"work_id":null,"year":1971},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:30.370688Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:27d5d49201c4738409371e4b65a039fb7604e90bdcb0169fa96cbcf7167506ed","observation_id":"00d8f182-ab52-47d9-8058-734c395a446f","resolution":{"observed_at":"2026-08-04T12:54:30.370688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:30.457634Z","title":"u ker, Luisa Bentivogli, and Marcello Federico. Report on the 11th IWSLT evaluation campaign. In Marcello Federico, Sebastian St \\","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:30.457634Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:33a8e5b6eacef52cb6381ed014c97fc7efae3d9d38018d6e8fcc4727c98d98df","observation_id":"5a81a44c-5501-4bb1-a19d-95d6a2fb30ee","resolution":{"observed_at":"2026-08-04T12:54:30.457634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-06T08:05:35.311510Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-04T12:54:30.547368Z","title":"Generating long sequences with sparse transformers","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:30.547368Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:61f75cbd448ee7d0b2214f4cacbcea7eb1f8186f5354c039fa4288b2824656ba","observation_id":"5af29c4f-d56f-4c78-ac2c-3a8c2f8f77cb","resolution":{"observed_at":"2026-08-04T12:54:30.547368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:30.602091Z","title":"Rethinking attention with performers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:30.602091Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:4a1dc8d0b0eddc04b73d5717e293ff45027fc2817b6893bd71484d9353428e83","observation_id":"cce563b0-900f-4561-a90d-b07ee1fdde09","resolution":{"observed_at":"2026-08-04T12:54:30.602091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-04T12:54:30.663535Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:30.663535Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:045fc1c6c134b218780e8d7e0d2ffc731ba6230e273322f18303e76db3afe272","observation_id":"20be47fb-d94d-4b85-8eb5-9b30cf963f76","resolution":{"observed_at":"2026-08-04T12:54:30.663535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:30.706584Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:30.706584Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:58fdca956ea1a709c21f03ea4a9a9e9a0231aeb9a2775b5541ae5003010f7bec","observation_id":"21a61534-ad57-4eeb-a424-c151aadd6afb","resolution":{"observed_at":"2026-08-04T12:54:30.706584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:30.763214Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:30.763214Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:f579fdb6ec6d73a25ed0a62055bd20eabff1a519a4ee9c284a07cc7bbd9a11a1","observation_id":"b6941ade-a66e-46b3-b115-1816909e2f36","resolution":{"observed_at":"2026-08-04T12:54:30.763214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:30.802792Z","title":"Sparsegpt: Massive language models can be accurately pruned in one-shot","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:30.802792Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:80931c3187c5f86e1461e4fa01f0967ffc7d8e03289df5b0d4b8633d51602055","observation_id":"a2bba1f1-1e01-4127-83a6-4f2bc1d452d3","resolution":{"observed_at":"2026-08-04T12:54:30.802792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:30.824068Z","title":"OPTQ : Accurate quantization for generative pre-trained transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:30.824068Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:303638a48f5d59d0fad0c2de991dd5f3c4b25bca97df506e8d07e73c7555c6ad","observation_id":"6010a440-46a5-4e74-89ff-412c8e4fa407","resolution":{"observed_at":"2026-08-04T12:54:30.824068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:30.865017Z","title":"Strategies for applying low rank decomposition to transformer-based models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:30.865017Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:0ac5bcfeb63aa4d7930e65694983bf5078ac3a5e3f7e1e3c9613869d1973d734","observation_id":"5a9db1f6-3352-4f02-9ef6-f5ca335451d4","resolution":{"observed_at":"2026-08-04T12:54:30.865017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:30.910134Z","title":"SLTrain : a sparse plus low-rank approach for parameter and memory efficient pretraining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:30.910134Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:7b55c50ad4b380f3dcc3c50231d5c518aca31040c2a8bdf676e44cec089d7b0d","observation_id":"a057aba3-d32e-4e15-9bf0-b17222eaee1d","resolution":{"observed_at":"2026-08-04T12:54:30.910134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:30.931321Z","title":"Language model compression with weighted low-rank factorization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:30.931321Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:38025be40122873a10674cc5101fa5413c59c06d3828d58aae4c5b0e268af0d3","observation_id":"be4e18b6-074b-42af-9377-38971a8d2709","resolution":{"observed_at":"2026-08-04T12:54:30.931321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:31.029756Z","title":"Lo RA : Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:31.029756Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:472c2b7d206f9a1606fb10b591190b97f7acf6b10a55f5f5b97c798133cc55cb","observation_id":"2a63d98f-6da0-464d-9196-37cc203100a1","resolution":{"observed_at":"2026-08-04T12:54:31.029756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11239","last_updated":"2025-06-07T06:59:36Z","snapshot_observed_at":"2026-08-04T13:43:35.284914Z","submitted_at":"2024-07-15T21:05:20Z","title":"From Low Rank Gradient Subspace Stabilization to Low-Rank Weights: Observations, Theories, and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11239","snapshot_observed_at":"2026-08-04T12:54:31.091978Z","title":"From galore to welore: How low-rank weights non-uniformly emerge from low-rank gradients","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:31.091978Z"},"links":{"cited_paper":"/paper/2407.11239","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:9e2ec3415c32f3c16750e0face2f55b8f737130fabd8bc96b094c8f826bf9881","observation_id":"2b676826-9b17-4b04-b090-538dc0d1f1d4","resolution":{"observed_at":"2026-08-04T12:54:31.091978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13569","last_updated":"2022-09-27T17:43:45Z","snapshot_observed_at":"2026-08-07T03:29:16.217842Z","submitted_at":"2022-09-27T17:43:45Z","title":"Exploring Low Rank Training of Deep Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13569","snapshot_observed_at":"2026-08-04T12:54:31.209617Z","title":"Exploring low rank training of deep neural networks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:31.209617Z"},"links":{"cited_paper":"/paper/2209.13569","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:c612f05d3f76964d7f1ca8bc76526cb97c917833efb534375b2fc6361f12cbe0","observation_id":"a6a14013-6408-4d60-858d-e52a7e75f9e7","resolution":{"observed_at":"2026-08-04T12:54:31.209617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:31.333202Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:31.333202Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:55dcf156a7524283acd0898908580360f2ad8a3c235ce917072a7ec1a704a5e9","observation_id":"631783ef-d799-40a2-8984-3a39a3333220","resolution":{"observed_at":"2026-08-04T12:54:31.333202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14021","last_updated":"2023-09-25T10:35:17Z","snapshot_observed_at":"2026-08-07T11:20:14.506370Z","submitted_at":"2023-09-25T10:35:17Z","title":"LORD: Low Rank Decomposition Of Monolingual Code LLMs For One-Shot Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14021","snapshot_observed_at":"2026-08-04T12:54:31.437126Z","title":"Lord: Low rank decomposition of monolingual code llms for one-shot compression","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:31.437126Z"},"links":{"cited_paper":"/paper/2309.14021","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:1c2066fb56704cf2a42970e54fdf1eacf4bb3d572cf609be26bf75087ca0d17e","observation_id":"dedb3b3c-0143-447c-86ac-5a807bdcfb2e","resolution":{"observed_at":"2026-08-04T12:54:31.437126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:31.557629Z","title":"Tenenholtz, Lester Mackey, and Nicolo Fusi","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:31.557629Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:3d97cef05a9c481c552f0041ea7cc98e1422f3ff14622a303f44773e53dd0132","observation_id":"ec62ac58-2159-4e00-978d-e4bd905ef6e1","resolution":{"observed_at":"2026-08-04T12:54:31.557629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:31.651506Z","title":"Reformer: The efficient transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:31.651506Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:5e710ffff9060efcf9ce09ea095fa00fc01b3c3deaa699c5dc74ffdbb74aa466","observation_id":"0f83de22-e96d-4476-9f62-7053a68070a3","resolution":{"observed_at":"2026-08-04T12:54:31.651506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:31.752334Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:31.752334Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:8c24bc492925c4e505224ca6ec12cd319d203512e6dd329b2f37a60a6b5c77ee","observation_id":"31db1703-5b8b-4a93-b2ca-a68b152ecc44","resolution":{"observed_at":"2026-08-04T12:54:31.752334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:31.894154Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:31.894154Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:eb1b08594cffd5b1e36fd6d1489099de431cfe46e26a6db6c9daa77904fa3025","observation_id":"643ba7d0-1136-467c-b008-08c2923f039d","resolution":{"observed_at":"2026-08-04T12:54:31.894154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:31.978012Z","title":"L o S parse: Structured compression of large language models based on low-rank and sparse approximation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:31.978012Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:c7ff939dbfda53c574e52f1890c7257f2d4b551285ef15e47665585bd5f8c638","observation_id":"01fa899c-3f53-4895-be6e-7047fb963ed7","resolution":{"observed_at":"2026-08-04T12:54:31.978012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:32.133004Z","title":"Relo RA : High-rank training through low-rank updates","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:32.133004Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:e0ccd53a1ba0d9e3c488f197103f68802c38e3a1e1f3680cf05ed8f9fa721c55","observation_id":"f261d3aa-14a0-4a8d-9c5a-d529ae8ba1dc","resolution":{"observed_at":"2026-08-04T12:54:32.133004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09632","last_updated":"2025-05-02T15:34:42Z","snapshot_observed_at":"2026-07-06T19:02:11.267510Z","submitted_at":"2024-08-19T01:30:14Z","title":"MoDeGPT: Modular Decomposition for Large Language Model Compression","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09632","snapshot_observed_at":"2026-08-04T12:54:32.247901Z","title":"Modegpt: Modular decomposition for large language model compression, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:32.247901Z"},"links":{"cited_paper":"/paper/2408.09632","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:667758c5b27cc1f358dc51b8b52319f98586cfe9a6327c9bac5e0aff8e9ad1f7","observation_id":"77cdf235-0bfd-4f03-99a5-b557d1825d12","resolution":{"observed_at":"2026-08-04T12:54:32.247901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:32.347427Z","title":"Duquant: Distributing outliers via dual transformation makes stronger quantized LLM s","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:32.347427Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:0b42616a5f104c006c621cab2a9d6e2b6ede3c1576cdf903e1de1189bb9ba946","observation_id":"83137743-3cb1-4ff3-b11a-6cf1c74487d4","resolution":{"observed_at":"2026-08-04T12:54:32.347427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:32.471274Z","title":"Awq: Activation-aware weight quantization for on-device llm compression and acceleration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:32.471274Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:a512c19bb449c5555157d197478a2a7d74d4f41dc1cb16973b7c94870a2189b9","observation_id":"9f0d11ae-4f6e-4531-a7cc-a1a6c23fc160","resolution":{"observed_at":"2026-08-04T12:54:32.471274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-04T12:54:32.527232Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:32.527232Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:397a94775fdd139794029dd32697c6903b578f7ac2b2eee0414f9850490a7b93","observation_id":"5ae5674c-ffb0-4b20-839e-613f321f3d60","resolution":{"observed_at":"2026-08-04T12:54:32.527232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-04T12:54:32.615317Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:32.615317Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:99b61285c07a621ccdacc1c64a9649b8d5c0778c9a56d6ae1dc165db6e686256","observation_id":"07b3b64d-3b08-49e8-8f1c-d43f6e3b80c1","resolution":{"observed_at":"2026-08-04T12:54:32.615317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:32.698827Z","title":"Dora: weight-decomposed low-rank adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:32.698827Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:22c839f84edec572e3238bcaf690570c07e257f00157b7cc7458078cae1917cc","observation_id":"0258c38e-9abe-4a8a-b13e-c7ebc7dac914","resolution":{"observed_at":"2026-08-04T12:54:32.698827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:32.861188Z","title":"Eora: Fine-tuning-free compensation for compressed llm with eigenspace low-rank approximation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:32.861188Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:a3375afb476e1a0b8a1e9dfb2e3b1a0678abe98d1b4228279a51b8929e7596e9","observation_id":"dd5384e6-bb56-4bcc-8dd3-d47a66c0135b","resolution":{"observed_at":"2026-08-04T12:54:32.861188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:32.977760Z","title":"Llm-pruner: On the structural pruning of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:32.977760Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:98251d8d451fe32f483071f41783aeb80f8df616a2ff6d38f292b59056fd237c","observation_id":"7ac60136-ac83-4676-a145-dda4bcac9790","resolution":{"observed_at":"2026-08-04T12:54:32.977760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:33.097917Z","title":"Pi SSA : Principal singular values and singular vectors adaptation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:33.097917Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:0aeb4613d271051d19091a796973076a7d943fdb1aa20efd8495cde710d1b7d5","observation_id":"953b5e5b-d8ec-4d75-a517-f86fd2b5d80d","resolution":{"observed_at":"2026-08-04T12:54:33.097917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08378","last_updated":"2021-04-16T21:27:32Z","snapshot_observed_at":"2026-08-04T11:24:11.301809Z","submitted_at":"2021-04-16T21:27:32Z","title":"Accelerating Sparse Deep Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08378","snapshot_observed_at":"2026-08-04T12:54:33.214208Z","title":"Accelerating sparse deep neural networks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:33.214208Z"},"links":{"cited_paper":"/paper/2104.08378","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:ba4d83de2d74a76d04083a0616bd9b2020b38af9f19e526b9dac0997b3b1b102","observation_id":"3dbea6ef-0b63-4017-9997-9c4ea74232fe","resolution":{"observed_at":"2026-08-04T12:54:33.214208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:33.322566Z","title":"Dobi-svd: Differentiable svd for llm compression and some new perspectives","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:33.322566Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:e162ef96e52e9b76f9e8cdb85bc5963e7cd29c0776b3f994599d01179dc4383d","observation_id":"d439b2ad-6e08-4225-bfbd-55466bb6f4e4","resolution":{"observed_at":"2026-08-04T12:54:33.322566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:33.440915Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:33.440915Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:bb4b5eb805266df2f589c88edc12362228f616ab1de2006102d958ccb6b8e47e","observation_id":"6f961544-b9b2-4dd2-8839-cc51cc6df62f","resolution":{"observed_at":"2026-08-04T12:54:33.440915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:33.536976Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:33.536976Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:20dfb5bec1cb5f6a25de97617b91f18070595ba532905109b8f6cbad06bde199","observation_id":"c43b9212-5043-4bf1-9d40-21ba7e391419","resolution":{"observed_at":"2026-08-04T12:54:33.536976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:33.587104Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:33.587104Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:6d7bcbd22b60bd3923e753672d19c70d3eb393f6ab0e61fd1e662c847c37e9ae","observation_id":"278dc369-fde2-4308-9668-e49d0114f923","resolution":{"observed_at":"2026-08-04T12:54:33.587104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:33.690785Z","title":"Compressing large language models using low rank and low precision decomposition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:33.690785Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:ea9b0f5eda70fcf33ff9482bb83812d52d3c5c4944d72aac1077e00d6ac69478","observation_id":"31e01949-78d7-4159-beb9-0126df88ca27","resolution":{"observed_at":"2026-08-04T12:54:33.690785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:33.809317Z","title":"ESPACE : Dimensionality reduction of activations for model compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:33.809317Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:373485add83d231c6c677d402e0c5bae9947fa595686674f59f06034abb29edd","observation_id":"342da8c0-a4e9-4b3f-9574-f2d413e0f6b4","resolution":{"observed_at":"2026-08-04T12:54:33.809317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:33.919849Z","title":"Robust low-rank training via approximate orthonormal constraints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:33.919849Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:4eb616dab712263789fcf469a1d344b669446574e46012c6206a86a4a942c395","observation_id":"e920ecbc-9788-49b6-8e95-0174b00261b3","resolution":{"observed_at":"2026-08-04T12:54:33.919849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:34.055161Z","title":"Low-rank lottery tickets: finding efficient low-rank neural networks via matrix differential equations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:34.055161Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:8c599b411b5ecb6fdc31091f24171422acec1a4369ccda91fdd48879c37f9d54","observation_id":"1ea1abe1-5963-4ead-a7f4-2d53663b6ac1","resolution":{"observed_at":"2026-08-04T12:54:34.055161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:34.234225Z","title":"Flashattention-3: Fast and accurate attention with asynchrony and low-precision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:34.234225Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:a77986e41a1519e972df3396925806df79d42e3d9f91b5899d1f2c34cf85f522","observation_id":"93e826c3-8a4c-4eb0-a545-a663f681d28b","resolution":{"observed_at":"2026-08-04T12:54:34.234225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13558","last_updated":"2023-12-21T03:51:08Z","snapshot_observed_at":"2026-08-06T06:46:25.135516Z","submitted_at":"2023-12-21T03:51:08Z","title":"The Truth is in There: Improving Reasoning in Language Models with Layer-Selective Rank Reduction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13558","snapshot_observed_at":"2026-08-04T12:54:34.403786Z","title":"The truth is in there: Improving reasoning in language models with layer-selective rank reduction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:34.403786Z"},"links":{"cited_paper":"/paper/2312.13558","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:0e3b0fa5c9e76410ee2e20c0fa6f0eaa1dace8c11ad28a67dc83cdc5ebe65003","observation_id":"586d5a36-5a80-422b-b19e-72f3bccac425","resolution":{"observed_at":"2026-08-04T12:54:34.403786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:34.560871Z","title":"Roformer: Enhanced transformer with rotary position embedding, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:34.560871Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:eb5a5a622e7c0f8fb61bebd814aa699a0622dacee189760d43c5834907e103fd","observation_id":"528f9003-faa7-48b4-80d5-90af2d766239","resolution":{"observed_at":"2026-08-04T12:54:34.560871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:34.725960Z","title":"A simple and effective pruning approach for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:34.725960Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:b66d48d690af66b0529eae9a5f326b61408a8b93649a91f9696229dc430f1ba9","observation_id":"18fd2129-8fbe-4609-949c-f15b7ecfa635","resolution":{"observed_at":"2026-08-04T12:54:34.725960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-04T12:54:34.850727Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:34.850727Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:98616438590a7488fa7b3a04dfdcc71360b49d5e3c52e97663727d913115987c","observation_id":"3ae9a8c8-8529-4874-9453-f8d373e940e4","resolution":{"observed_at":"2026-08-04T12:54:34.850727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:34.978563Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:34.978563Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:b2802c113224fb4b2f06639f53ae431a571574eb4dc0e156f4191ef935334e29","observation_id":"3e2ec9d2-3863-4724-a5b5-713fdfd1aa2f","resolution":{"observed_at":"2026-08-04T12:54:34.978563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:35.063112Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:35.063112Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:a41374c65d9b9793a27838aeee9a6e511ddd43dcb4f5a38fbec8553b9d07f390","observation_id":"f0136548-5b07-446f-8cd5-045e713c7f8b","resolution":{"observed_at":"2026-08-04T12:54:35.063112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-08-04T12:54:35.148840Z","title":"Linformer: Self-attention with linear complexity","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:35.148840Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:cab6e401d801febe1e2a16403c05c165516a9621adea280fa0ed311003112a21","observation_id":"bec3bf8d-1d0f-4873-9ac4-a9fea3897be1","resolution":{"observed_at":"2026-08-04T12:54:35.148840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07378","last_updated":"2025-03-16T03:27:33Z","snapshot_observed_at":"2026-07-06T17:43:05.793351Z","submitted_at":"2024-03-12T07:31:18Z","title":"SVD-LLM: Truncation-aware Singular Value Decomposition for Large Language Model Compression","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07378","snapshot_observed_at":"2026-08-04T12:54:35.258159Z","title":"Svd-llm: Truncation-aware singular value decomposition for large language model compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:35.258159Z"},"links":{"cited_paper":"/paper/2403.07378","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:d880ce66cd65cef62b4c8840b4f85c885fd96f9a7efb74f8ab0bf7d82f409711","observation_id":"d362884c-1a04-4ac8-93cd-c40cc7ca3094","resolution":{"observed_at":"2026-08-04T12:54:35.258159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:35.361956Z","title":"S mooth Q uant: Accurate and efficient post-training quantization for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:35.361956Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:a9c5cfa1af102d91160c33091d6d2ac043ee5353a380e690328de4bfa3359b91","observation_id":"c321b518-a77c-447f-97dd-88711359f07e","resolution":{"observed_at":"2026-08-04T12:54:35.361956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05821","last_updated":"2025-08-28T03:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-10T08:41:24Z","title":"ASVD: Activation-aware Singular Value Decomposition for Compressing Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05821","snapshot_observed_at":"2026-08-04T12:54:35.464572Z","title":"Asvd: Activation-aware singular value decomposition for compressing large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:35.464572Z"},"links":{"cited_paper":"/paper/2312.05821","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:2cdc6a0ae17039de084f7482bed0da2443bc525ecb80dfcefa366cedf44292c2","observation_id":"3a849161-2923-4d55-bd1f-e3a7efe8544a","resolution":{"observed_at":"2026-08-04T12:54:35.464572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12043","last_updated":"2023-08-23T10:08:10Z","snapshot_observed_at":"2026-07-06T16:09:28.325603Z","submitted_at":"2023-08-23T10:08:10Z","title":"IncreLoRA: Incremental Parameter Allocation Method for Parameter-Efficient Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12043","snapshot_observed_at":"2026-08-04T12:54:35.581040Z","title":"Increlora: Incremental parameter allocation method for parameter-efficient fine-tuning, 2023 a","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:35.581040Z"},"links":{"cited_paper":"/paper/2308.12043","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:ffcba430f934cc14de9fb2e7cca9cdc23570c9fee885a091fc088928c7897802","observation_id":"fd338049-9301-4ef7-b7ea-92b6c9f09adf","resolution":{"observed_at":"2026-08-04T12:54:35.581040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:35.660902Z","title":"Adaptive budget allocation for parameter-efficient fine-tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:35.660902Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:db26c82fff5a3f9752f705a156889268e660cea80aa8dd4c1a1b27cbfa4a70a0","observation_id":"a45d9535-e250-4bd4-bb31-6d366b7a860a","resolution":{"observed_at":"2026-08-04T12:54:35.660902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:35.775920Z","title":"OATS : Outlier-aware pruning through sparse and low rank decomposition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:35.775920Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:439fc8e09f1b5463ed6f5a47c56ef290c737e4d82ee77b3a2a8526eeeaaca893","observation_id":"b1bce96b-694c-43aa-9b5e-4f059156fc26","resolution":{"observed_at":"2026-08-04T12:54:35.775920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:35.900097Z","title":"Plug-and-play: An efficient post-training pruning method for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:35.900097Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:0ac983f0534687052ca67b7c690f4c44cfcde3375a3b7ae3c0c3d2e969b9b9bf","observation_id":"dc3d7516-ad5f-4dd5-a41c-de003089dfb9","resolution":{"observed_at":"2026-08-04T12:54:35.900097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19090","last_updated":"2025-08-13T06:56:55Z","snapshot_observed_at":"2026-07-06T20:28:57.453439Z","submitted_at":"2025-01-31T12:36:31Z","title":"Pivoting Factorization: A Compact Meta Low-Rank Representation of Sparsity for Efficient Inference in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19090","snapshot_observed_at":"2026-08-04T12:54:35.977946Z","title":"Pivoting factorization: A compact meta low-rank representation of sparsity for efficient inference in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:35.977946Z"},"links":{"cited_paper":"/paper/2501.19090","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:5b38c1f74becbc3dd2c54fd38a7c897ca2f9848df461e9f9f04ad1df26a4eca2","observation_id":"0f894493-e622-4418-a1e9-097317145de2","resolution":{"observed_at":"2026-08-04T12:54:35.977946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11250","last_updated":"2024-01-01T03:43:41Z","snapshot_observed_at":"2026-08-06T13:53:33.999451Z","submitted_at":"2023-06-20T03:03:04Z","title":"InRank: Incremental Low-Rank Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11250","snapshot_observed_at":"2026-08-04T12:54:36.066165Z","title":"Inrank: Incremental low-rank learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:36.066165Z"},"links":{"cited_paper":"/paper/2306.11250","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:5eeec963c9cfe71735583e2512bd98afc25aa1f7020437efe0c38e7406f20c74","observation_id":"6dd34c8b-9224-430b-aadc-c57a7b72dc78","resolution":{"observed_at":"2026-08-04T12:54:36.066165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:36.165106Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:36.165106Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:e7533d3277897b20537506de16cda36af9fd42a8abd08383861c0d040febd66a","observation_id":"2f8f7a76-881c-47a7-8042-894e98116cea","resolution":{"observed_at":"2026-08-04T12:54:36.165106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:36.285194Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:36.285194Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:8a49e4e94acf798935ca8a26add506cf9f97c8041e711717f56a95cd7b4f00a8","observation_id":"1d17f1a5-7d81-45eb-8f50-b2065d4371e8","resolution":{"observed_at":"2026-08-04T12:54:36.285194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:36.403613Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:36.403613Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:71a851b16e7f06d0026cd41fe7084997659106fc7541fbd7c307c0e3645b0160","observation_id":"93e27143-3258-49e6-9bd8-d9078579c549","resolution":{"observed_at":"2026-08-04T12:54:36.403613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:36.489014Z","title":"u `:^!t )GeuwokcJ _ ]n?ICq .WT +BCBC &q=2","venue":null,"work_id":null,"year":2060},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:36.489014Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:601a8f172c596a51dc024c26b1970af43956d3f15f28b3dd23a60ae5a90120c6","observation_id":"07ee1195-c7ea-4742-86e3-af5f4901c69b","resolution":{"observed_at":"2026-08-04T12:54:36.489014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T05:19:59.381823Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":65,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 0 inbound Pith citation observations for arXiv:2510.01718."}