{"as_of":"2026-08-16T19:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:589f0500f59ade51b649b297754e9ee6f5e3ea088ab2ddf08fdb4b78dd30b3bb","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T22:44:39.644854Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.03214/citation-record","integrity":"/paper/2412.03214/integrity","json":"/paper/2412.03214/citation-record.json","paper":"/paper/2412.03214"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:37.560811Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:37.560811Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:77a479c69642a70c2f1c7933766a98cbdc2f9be6e512ff158b0d78dfb8c103fb","observation_id":"83a7882d-d623-4b10-a68b-fc7d063bb216","resolution":{"observed_at":"2026-08-11T22:44:37.560811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:42.107421Z","title":"Trans- formers in the real world: A survey on NLP applications","venue":null,"work_id":"106853b5-3c5a-41ba-9b66-58761efe2b2e","year":2023},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:37.585313Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:f576bd4361b384b469059800d99e644b75a00f0e5c82853e0b13ef9a1dd9bb7b","observation_id":"d9e8ee95-a755-45e8-b082-363e52dccca1","resolution":{"observed_at":"2026-08-11T22:44:42.116252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:42.090548Z","title":"Transformer architecture and attention mechanisms in genome data analysis: A comprehensive review","venue":null,"work_id":"73efb55e-3db4-4acb-a756-8cc53601d6b6","year":2023},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:37.608725Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:a81eedbdabafce7701d7f3152b3901c39feaf6a5aa0aa400726f32516c9451f7","observation_id":"309c28f1-4373-43ca-88e0-f0413ab061a8","resolution":{"observed_at":"2026-08-11T22:44:42.095133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.05700","last_updated":"2022-09-13T02:57:05Z","snapshot_observed_at":"2026-08-16T16:33:00.014933Z","submitted_at":"2022-09-13T02:57:05Z","title":"Vision Transformers for Action Recognition: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.05700","snapshot_observed_at":"2026-08-11T22:44:37.631872Z","title":"Vision transformers for action recognition: A survey","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:37.631872Z"},"links":{"cited_paper":"/paper/2209.05700","citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:2e0aa36fc35b4c7dd7bd538b3c7aeb90a79945a648b947b83729f8107c818940","observation_id":"cdbf2adc-389f-42ae-ae75-7c64cbf05300","resolution":{"observed_at":"2026-08-11T22:44:37.631872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:37.658027Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:37.658027Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:b0140b2f3c82912f0b7acf71adef9466c35dbf55368673c7eec3191c209d935b","observation_id":"7c031925-eda3-4cab-a169-f101a01fca84","resolution":{"observed_at":"2026-08-11T22:44:37.658027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:42.059635Z","title":"Singh, Muskaan Chopra, Sudhakar Kumar, and Francesco Colace","venue":null,"work_id":"9203269e-d68e-48d4-b58a-b3a413e0222a","year":2022},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:37.665357Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:86d4e5e8175ca10cc82d49aae3b1deabeae67545ac3198645f6daad40fcb0884","observation_id":"08f7b4d3-2a99-4f6c-8ad6-3359775363da","resolution":{"observed_at":"2026-08-11T22:44:42.064666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:42.017185Z","title":null,"venue":null,"work_id":"a8d3de24-1c13-4494-bb51-c9935ffc9491","year":2023},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:37.672574Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:719e5eb174784401e87e4e7526dff57fa1d3f022e0fccfe5ddde7e444c3a8b8f","observation_id":"8dcf52df-da94-4a1a-bbe6-8c7341c60f5e","resolution":{"observed_at":"2026-08-11T22:44:42.046836Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13912","last_updated":"2024-01-25T03:14:07Z","snapshot_observed_at":"2026-08-16T14:24:41.272423Z","submitted_at":"2024-01-25T03:14:07Z","title":"A Survey of Deep Learning and Foundation Models for Time Series Forecasting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13912","snapshot_observed_at":"2026-08-11T22:44:37.678717Z","title":"Miller, Mohammed Aldosari, Farah Saeed, Nasid Habib Barna, Subas Rana, Ismailcem Budak Arpinar, and Ninghao Liu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:37.678717Z"},"links":{"cited_paper":"/paper/2401.13912","citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:ce82e841fb869cc0942ebf85fea0f86521da4214e38197aacfe25044bb52e885","observation_id":"c633bb72-ae33-4ffb-acac-0e1585a0e699","resolution":{"observed_at":"2026-08-11T22:44:37.678717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:41.930974Z","title":"Single-layer Vision Transformers for more accurate early exits with less overhead","venue":null,"work_id":"4095b6e0-81b7-496d-bf6e-3b3e7666cb45","year":2022},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:37.687415Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:afd753b6cda3d683f59daa4555a0f9fe824425dfe06e4f912d1b8563480aad07","observation_id":"1320ca10-055f-4a0d-93b5-a468a428c8e5","resolution":{"observed_at":"2026-08-11T22:44:41.957365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:41.878321Z","title":"Efficient High-Resolution Deep Learning: A Survey","venue":null,"work_id":"c432de70-73c7-46fb-b51d-18a38fca32de","year":2024},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:37.693455Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:87f53d3ee49c64e31387e7226f3cb3a0dd11f9eb41c9375c0683db8e4a6d0128","observation_id":"21a2c198-fe2b-4800-a2fa-e56f3f188726","resolution":{"observed_at":"2026-08-11T22:44:41.914753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:41.772601Z","title":"Reducing transformer depth on demand with structured dropout","venue":null,"work_id":"ef37c7d4-0f04-498d-af1b-b6f30789c1cf","year":2020},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:37.709719Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:4a8a81a906b4c94e78a0568f1ef3112601f760353b712019e5ba50cb2e519901","observation_id":"2a48665e-950a-4eaa-b1ee-1195e1c47984","resolution":{"observed_at":"2026-08-11T22:44:41.798661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00230","last_updated":"2024-03-07T10:25:20Z","snapshot_observed_at":"2026-08-16T14:30:45.897592Z","submitted_at":"2023-12-30T13:44:23Z","title":"Transformer Multivariate Forecasting: Less is More?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00230","snapshot_observed_at":"2026-08-11T22:44:37.741777Z","title":"Transformer multivariate forecasting: Less is more? arXiv:2401.00230, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:37.741777Z"},"links":{"cited_paper":"/paper/2401.00230","citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:2f3f548186755f29d3a7885dfc00398206773fbabd83c087a44642ba9e012e39","observation_id":"47b7b396-2cc8-4173-9b52-834147af03f7","resolution":{"observed_at":"2026-08-11T22:44:37.741777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:41.743906Z","title":"Informer: Beyond efficient transformer for long sequence time-series forecasting","venue":null,"work_id":"caa2a3cb-5dea-470b-9df4-43c351b3ca1a","year":2021},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:37.784016Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:41def7409673370dc2e406c5f8f800a0fa4f28427a39e407aa052bb9bae7dda0","observation_id":"1381d7d6-c38f-4296-9cbf-46b3f1961653","resolution":{"observed_at":"2026-08-11T22:44:41.757602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-16T10:03:03.268538Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-11T22:44:37.824736Z","title":"Generating long sequences with sparse transformers","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:37.824736Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:6f42653afdc4e5868f9ee377ea2ede78f841ede198e01941bc4bf167fbb73258","observation_id":"30e07cca-337d-4c57-95b1-2a9e25c3d1d0","resolution":{"observed_at":"2026-08-11T22:44:37.824736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-11T22:44:37.885666Z","title":"Peters, and Arman Cohan","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:37.885666Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:ab997f5b3c1e1e4211712c010f4cbfb6629ae21d5435e708d5b41db2a63f994d","observation_id":"657ca656-b3a5-445c-b4b0-a702e519e3b8","resolution":{"observed_at":"2026-08-11T22:44:37.885666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:41.716628Z","title":"Colwell, and Adrian Weller","venue":null,"work_id":"e9c42973-b106-474b-b7c1-13ca43a50118","year":2021},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:37.926721Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:50cc315aa5369ef8b2b546f87232ee652a73a22973887aba9ef8a23b57347a8c","observation_id":"18ed6feb-b2d0-4764-a462-022723270451","resolution":{"observed_at":"2026-08-11T22:44:41.722643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:41.656491Z","title":null,"venue":null,"work_id":"f410c0d7-31ae-4a76-aca7-41b2cece61ce","year":2005},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.004831Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:1f6a0b764ce078669a4c2e5e3d58e1255df2033beeb30976eb339167eaf6dd66","observation_id":"33154db5-73dc-4163-be7d-057b180bb6fc","resolution":{"observed_at":"2026-08-11T22:44:41.691539Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:41.546871Z","title":"On compressing deep models by low rank and sparse decomposition","venue":null,"work_id":"d8302ec8-d732-4141-9ac7-722765377566","year":2017},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.074819Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:82c4ad141661a02a8887c2951035b9872cdb6d8ccd88aa75e2c21372f429c183","observation_id":"0c206191-9b08-4ce4-9273-d89ee9b659bd","resolution":{"observed_at":"2026-08-11T22:44:41.619889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:41.502317Z","title":"Nystr ¨omformer: A nystr ¨om- based algorithm for approximating self-attention","venue":null,"work_id":"51165003-b638-4faa-a117-6258dcd5ec32","year":2021},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.113281Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:d4f008f44732889e8a72bfdf8ca277c630f27cf8e86b39652ad6cae2540aacf6","observation_id":"482af051-da69-4fec-8bb6-bcb2d36bc70f","resolution":{"observed_at":"2026-08-11T22:44:41.518206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:41.486433Z","title":null,"venue":null,"work_id":"ea8350c4-2fa8-4a2c-9ac9-6068f7f61479","year":2021},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.152983Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:f975488d260f87fdba4bf8245b8ab11adadefbc5d779cd965e4aaa945cd9914d","observation_id":"eb233905-3fc3-4df1-8bd8-3d133d3b2ae4","resolution":{"observed_at":"2026-08-11T22:44:41.491454Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:41.414975Z","title":"Cvt: Introducing convolutions to vision transformers","venue":null,"work_id":"c03b76d8-7a8b-49d8-a495-bd005e855065","year":2021},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.187980Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:2bb1fe80a62059d7c65a199f0e35ff23bb00310824917fad864995c6a1eb978e","observation_id":"7fec859d-ce3d-4cd7-a76e-129963bb2511","resolution":{"observed_at":"2026-08-11T22:44:41.438242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:41.354747Z","title":"Khan, Muzammal Naseer, Munawar Hayat, Syed Waqas Zamir, Fahad Shahbaz Khan, and Mubarak Shah","venue":null,"work_id":"0b0ac7d9-6703-41e5-9883-218e32e4ac09","year":2022},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.233332Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:68b9b50ce4822dc9399f92bd78165700bc1fa75ab826ac778456ac1762a371fc","observation_id":"8f04936d-ae7b-4c44-ab1c-581c45bfba35","resolution":{"observed_at":"2026-08-11T22:44:41.400138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:41.210578Z","title":"Is space-time attention all you need for video understanding? In International Conference on Machine Learning , pages 813–824, 2021","venue":null,"work_id":"bff9eb11-fc40-47ed-87bc-5a34f47607aa","year":2021},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.261477Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:fbadf6e9f51c9c8662326f83f6188fceb94896651d397fa7b542f745ca342ceb","observation_id":"9325c7c2-9068-4b8a-8a04-e45a2970a68a","resolution":{"observed_at":"2026-08-11T22:44:41.229959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:41.147928Z","title":"Video swin transformer","venue":null,"work_id":"cd2bdd1e-c7ff-4b48-94dc-616de704f487","year":2022},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.271563Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:2050e8ae050c838d9742bc425d7bb9cb3b634c2de5c576e4e96335541f13973a","observation_id":"244c4f92-1030-4139-a755-de2cbb375f73","resolution":{"observed_at":"2026-08-11T22:44:41.159513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:41.064793Z","title":"Vivit: A video vision transformer","venue":null,"work_id":"16cf5755-84cc-4bdf-813a-3be2d1eddaad","year":2021},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.278243Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:b907162eb5c56e2e71d6fc5fd7a7793dc58daa15a025b67c95a6d4f732e6db8e","observation_id":"cf1ba3af-7d2f-4c83-aacd-caffe87114eb","resolution":{"observed_at":"2026-08-11T22:44:41.073936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:41.004904Z","title":"Multiscale vision transformers","venue":null,"work_id":"16e7ab3c-3b5b-4ab6-94cb-00a3e4be7fba","year":2021},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.288171Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:cf0b9d9ecc92561ed2a6409b00b77c873d0a1ec6c16287909c06f4494d5db445","observation_id":"9dc1b33e-e954-4c81-9d43-c3e96c4862ba","resolution":{"observed_at":"2026-08-11T22:44:41.039577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.836055Z","title":"Continual inference: A library for efficient online inference with deep neural networks in pytorch","venue":null,"work_id":"db51c297-12bb-4c8b-a1db-26349f3b47da","year":2022},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.297757Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:777ef2177ff0b242e2cec532fa782c09f2ba95ab014d5cb9c723fc6250f9913f","observation_id":"e85fd8f0-7c47-4960-875d-f2e66f881132","resolution":{"observed_at":"2026-08-11T22:44:40.874754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.05911","last_updated":"2019-11-23T06:36:13Z","snapshot_observed_at":"2026-08-10T18:23:52.033853Z","submitted_at":"2019-11-23T06:36:13Z","title":"Recurrent Neural Networks (RNNs): A gentle Introduction and Overview","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.05911","snapshot_observed_at":"2026-08-11T22:44:38.334752Z","title":null,"venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.334752Z"},"links":{"cited_paper":"/paper/1912.05911","citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:7cc1b0f61fba41c5e82f56a84a14924d9907501296e93b66eecc63fde4a570ce","observation_id":"441c2d58-0a39-4922-b48e-94bf01d15d6b","resolution":{"observed_at":"2026-08-11T22:44:38.334752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.03314","last_updated":"2023-07-31T00:06:04Z","snapshot_observed_at":"2026-08-15T06:55:15.143623Z","submitted_at":"2018-08-09T19:31:42Z","title":"Fundamentals of Recurrent Neural Network (RNN) and Long Short-Term Memory (LSTM) Network","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.03314","snapshot_observed_at":"2026-08-11T22:44:38.424754Z","title":"Fundamentals of recurrent neural network (RNN) and long short-term memory (LSTM) network","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.424754Z"},"links":{"cited_paper":"/paper/1808.03314","citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:a97d0df19a1bcbf08944aabfb042eb71826d4046fad0a9e30547c89d7718b7c3","observation_id":"b0d4dba8-0bcf-44ad-a636-4c1860f81a45","resolution":{"observed_at":"2026-08-11T22:44:38.424754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-11T22:44:38.496915Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.496915Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:f91ed0c1e81a7f595cc4acd54af8795565cf4306191208f4772938823df36cfa","observation_id":"2044053f-ad31-4bb8-8800-96f6f7ac2bfb","resolution":{"observed_at":"2026-08-11T22:44:38.496915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.771888Z","title":"Con- tinual transformers: Redundancy-free attention for online inference","venue":null,"work_id":"881f77b6-afd0-438c-821a-2d5725512217","year":2023},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.574754Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:64d5ed83495ab6f31c441beddad68caa83772c96231ca1c0865db252398f9f2a","observation_id":"d264e9e3-0d8e-4735-8b9a-3f2a6a9d6d70","resolution":{"observed_at":"2026-08-11T22:44:40.788814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.750678Z","title":"Continual spatio-temporal graph convolutional networks","venue":null,"work_id":"b7e54ae2-3dcd-49f8-a9a0-375a912c0164","year":2023},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.654762Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:3e385227adc20dad15b07470be66ac9b331e9d89fdcd3299c4674bb0ada97b7e","observation_id":"b0f1d5b5-ebc6-414a-b48f-f7ce3bf69179","resolution":{"observed_at":"2026-08-11T22:44:40.757538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.722067Z","title":"Continual 3d convolutional neural networks for real-time processing of videos","venue":null,"work_id":"f2c97fbc-fdda-4204-ae50-d0d29f11fcda","year":2022},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.676956Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:72cace8f85e8f550ab8108d151663542ca20cb8ba031409710c7433ed7e02641","observation_id":"8d2f63dd-9cd7-4759-a86b-49399ca1f81d","resolution":{"observed_at":"2026-08-11T22:44:40.728866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.02239","last_updated":"2021-10-01T15:08:54Z","snapshot_observed_at":"2026-08-16T18:12:10.730504Z","submitted_at":"2021-07-05T19:24:23Z","title":"Vision Xformers: Efficient Attention for Image Classification","version":4},"cited_work":{"arxiv_id":"2107.02239","doi":null,"metadata_source":"pith","pith_arxiv_id":"2107.02239","snapshot_observed_at":"2026-08-11T22:44:39.792276Z","title":"Vision Xformers: Efficient Attention for Image Classification","venue":"cs.CV","work_id":"c519ae82-9dca-4dcd-91fc-17e3dcf9c371","year":2021},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.692313Z"},"links":{"cited_paper":"/paper/2107.02239","citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:67ca8cb28c68a00e35e6aed4cc44eeaff34285a39ac43b29b99f64b45f24db8f","observation_id":"8a4844b2-ca53-42ac-b7e9-81674a1eab92","resolution":{"observed_at":"2026-08-11T22:44:39.810327Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.699666Z","title":null,"venue":null,"work_id":"b8e09968-f3af-429b-894c-363f86293102","year":2001},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.711690Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:ae471082194da481414deb8215e756aebd2fe1574a13663a8f8ea784e8446e26","observation_id":"df2aa885-c7d9-4d02-b71f-dd91d41e02d2","resolution":{"observed_at":"2026-08-11T22:44:40.704544Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.649245Z","title":"Improving CUR matrix decomposition and the nystr ¨om approximation via adaptive sampling","venue":null,"work_id":"ea878b32-9ee3-4eb9-a7b3-086e499e53cc","year":2013},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.730191Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:f1dbbe07a3ba382fbc94b7932f340359374c6fafb41575a556a4a52419ad4389","observation_id":"bd29012b-19ed-4aa8-9190-82c481547247","resolution":{"observed_at":"2026-08-11T22:44:40.664219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.604752Z","title":"Asano, Ishan Misra, Florian Metze, Christoph Feichtenhofer, Andrea Vedaldi, and Jo˜ao F","venue":null,"work_id":"3f753802-8e5a-4e5a-9dc5-a800553427e5","year":2021},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.747057Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:743ba4751752314676041d595489c87f9904915788389800812624e28e402657","observation_id":"45102145-f9a7-42e6-9079-5fad17f40a35","resolution":{"observed_at":"2026-08-11T22:44:40.634763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.560797Z","title":"Eventful transformers: Leveraging temporal redundancy in vision transformers","venue":null,"work_id":"78453fca-7839-4c6c-8b5b-2974d8ab9aee","year":2023},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.763874Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:3030b948eb9f2eb1547e28c11cf8c742f34cd4397b2551c52d88077ec142361e","observation_id":"620357d3-163d-4eb3-a11f-f13997d261b3","resolution":{"observed_at":"2026-08-11T22:44:40.573467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.544752Z","title":"SOFT: softmax-free transformer with linear complexity","venue":null,"work_id":"786bb471-a543-4905-9252-fea760b7d9a0","year":2021},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.776102Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:b31fbcd4be968c1b0965dee0bfdf568e23795e38fa48785f27c2b7be3228acc7","observation_id":"480e11bc-f926-4ba9-a14d-ba55add0535f","resolution":{"observed_at":"2026-08-11T22:44:40.549808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.521954Z","title":"Adaptive multi-resolution attention with linear complexity","venue":null,"work_id":"b19f4ec1-e3d2-421b-84ce-2904540bcd05","year":2023},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.786218Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:4a4bbf5c3dfed7a9ce01d72508926f4544b9e6ed48754982af6afd30ffa74ccb","observation_id":"9bde083f-78fd-4cf1-b7fd-a96e666e84c3","resolution":{"observed_at":"2026-08-11T22:44:40.526966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.500069Z","title":"Kwok, Slobodan Vucetic, and Bahram Parvin","venue":null,"work_id":"9c3eed30-4a04-4e99-95f1-de150b872114","year":2015},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.806535Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:5d35851edef4de6bb79e9274482e110f33dc4efc0b12d971dd68c7728adcfc62","observation_id":"14bcae77-5745-44ec-aa1a-0621c15731f8","resolution":{"observed_at":"2026-08-11T22:44:40.504483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.485637Z","title":"Scaling Up Class-Specific Kernel Discriminant Analysis for Large-Scale Face Verification","venue":null,"work_id":"7fdcbdff-9a92-40a2-8e3b-24e47f7d2a13","year":2016},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.830629Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:591940d4d2e46315c8009a3d635311a831984dc69444f6bda41cc2c838357255","observation_id":"2187b7f2-73f8-41c2-92d7-025cd52f77b3","resolution":{"observed_at":"2026-08-11T22:44:40.490992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.463955Z","title":null,"venue":null,"work_id":"829559a3-2276-48d1-ad03-f8c5f915c4b2","year":2010},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.847533Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:0b71543b401737644ed7a3089c7ce49f1ef30202cb1eb34aa39cbd0295099b90","observation_id":"713ab673-31da-436a-9487-5088d642b9c8","resolution":{"observed_at":"2026-08-11T22:44:40.468909Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.425916Z","title":"Razavi, A","venue":null,"work_id":"f0920b0d-638b-450b-8816-6b854b32fe9e","year":2014},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.918263Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:1d239ce41c6d4d6d23a223facce0abda2100d2460f492b4c19cc5621e4c3daea","observation_id":"966c9101-4ecb-47bf-9b51-f5114dfed757","resolution":{"observed_at":"2026-08-11T22:44:40.444590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.406616Z","title":"Yang, Zachary DeVito, Martin Raison, Alykhan Tejani, Sasank Chilamkurthy, Benoit Steiner, Lu Fang, Junjie Bai, and Soumith Chintala","venue":null,"work_id":"5b1e9cd7-b3b9-461c-bcd9-42a9d9866c76","year":2019},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:39.002918Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:48d04e4a21ca560ea292bee5ed96db05a2470e812737dc108f359992638c501a","observation_id":"1ce32579-6c34-40c5-853d-c2b6589cac75","resolution":{"observed_at":"2026-08-11T22:44:40.411820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:39.077024Z","title":"Deep Learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:39.077024Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:da6d74f40775eaf104197466e33721ce99094c2ada591795b5bf1f8884aa0470","observation_id":"3f276387-f333-4237-8a4f-81244191b6fd","resolution":{"observed_at":"2026-08-11T22:44:39.077024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.369093Z","title":"A scale for the measurement of the psychological magnitude pitch","venue":null,"work_id":"bd7d5042-19d6-4fd2-b784-fe3991d0fbbb","year":1937},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:39.114723Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:292fb841ef81b99af9f419cbac043d9ee6991b063ed096df344fa4e9954f9f08","observation_id":"89eb0dd3-f32d-46b6-bfba-9a2b66c8a1fb","resolution":{"observed_at":"2026-08-11T22:44:40.373758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.351735Z","title":null,"venue":null,"work_id":"52207d1c-577e-4e09-b6ec-2e277afb044b","year":2016},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:39.136926Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:bafba0c46d1a0b701a50561c920ae807e430823cf2761afd3699f38a4536374a","observation_id":"2b540d7a-cd01-4458-bbf1-a159ad915c63","resolution":{"observed_at":"2026-08-11T22:44:40.357671Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.11154","last_updated":"2020-11-13T19:09:09Z","snapshot_observed_at":"2026-08-13T10:14:31.550038Z","submitted_at":"2020-07-22T01:31:44Z","title":"Rethinking CNN Models for Audio Classification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.11154","snapshot_observed_at":"2026-08-11T22:44:39.145701Z","title":"Rethinking CNN models for audio classification","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:39.145701Z"},"links":{"cited_paper":"/paper/2007.11154","citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:14438569d3336f7230e8d8f4336e21bc0738bce3e0d4d00d9ca4eb2674172e82","observation_id":"246b5cb2-cd41-4610-80b0-526f39841219","resolution":{"observed_at":"2026-08-11T22:44:39.145701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.329524Z","title":null,"venue":null,"work_id":"b1015568-a38c-455b-a948-5309e4dc222a","year":2002},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:39.158420Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:9a68565e59f51a6f87c63819005897983171045853c2c21f24940a33938cedaf","observation_id":"b45f7573-7419-4ec0-b994-4f31ada548cd","resolution":{"observed_at":"2026-08-11T22:44:40.338794Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:39.194753Z","title":"Very deep convolutional networks for large-scale image recognition","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:39.194753Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:75902fe3a0ef720c56c891a13ebdd031d6e7a8fe3c959d6c5f477e76cd47688b","observation_id":"ce5d047b-73b8-477f-8287-a4cd9120388c","resolution":{"observed_at":"2026-08-11T22:44:39.194753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.293114Z","title":null,"venue":null,"work_id":"76de4047-4155-410c-ad2e-6fc1bca742ef","year":2017},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:39.244752Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:77bce4a3778033b3a88aa70e6058ebe8097e57e59430615ad960c318ca06c38a","observation_id":"8ea7da11-24b8-41ff-8603-654785156cf4","resolution":{"observed_at":"2026-08-11T22:44:40.298730Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.274355Z","title":"Online action detection","venue":null,"work_id":"5012fc87-6d45-403c-87eb-fd21fa11679c","year":2016},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:39.295397Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:8d5ccab66149d40cb74ad76643bdf00d1a7844f9f1ad4e919b16bcd1d329f51d","observation_id":"aa2b296a-426a-4a16-b7ac-524fce1674db","resolution":{"observed_at":"2026-08-11T22:44:40.281898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.243071Z","title":"Zamir, Yu-Gang Jiang, Alex Gorban, Ivan Laptev, Rahul Sukthankar, and Mubarak Shah","venue":null,"work_id":"009d9aa1-ecc3-41b0-9a41-c2bb627d10fe","year":2017},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:39.354753Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:bc94de3134f9071c9459007a35f8c0d55efd71122f76f64a04d3e4e8aac036ad","observation_id":"3f8c1463-21a2-4cb9-a3c2-33e8f22e3d3d","resolution":{"observed_at":"2026-08-11T22:44:40.261641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.225496Z","title":"Learning to discriminate information for online action detection: Analysis and application","venue":null,"work_id":"bbcb46e4-310e-452b-86a8-86c3f9045934","year":2023},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:39.404751Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:fd2b02fef6973659e1c95da9b14ecb93a04a3d9e9955d814a00b2cbd8c7083ff","observation_id":"d644c828-e7e8-4883-a254-386ce7b32b06","resolution":{"observed_at":"2026-08-11T22:44:40.232066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.193266Z","title":"Temporal segment networks for action recognition in videos","venue":null,"work_id":"fa3034b2-c05a-40f3-b1ca-3984d98e83a2","year":2019},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:39.454753Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:f80b4447e22ea1ccb6c6246cfadf119c4ab51ae6e4137a6b99c09ea8f3324007","observation_id":"d484079c-0c8a-4fa6-9de2-1ecc11c7a361","resolution":{"observed_at":"2026-08-11T22:44:40.206663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.170813Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":"64fc1b56-0fbb-4339-8279-92ce3c48ff0c","year":2015},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:39.494828Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:e0df80d84bba198f3623805507594f2d22747020a254790f48b0bd5836371222","observation_id":"c2dd5313-df5e-4812-a86a-4496c3463baa","resolution":{"observed_at":"2026-08-11T22:44:40.178237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.147398Z","title":"Quo vadis, action recognition? A new model and the kinetics dataset","venue":null,"work_id":"ea18f2a5-3471-44b0-ae3c-ade8878def18","year":2017},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:39.544754Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:10b23762c5b737e113b438d6fb7b55805e83961370016864c228f1381d07056b","observation_id":"ddec96f0-c937-4bec-afda-fb7fde1d1809","resolution":{"observed_at":"2026-08-11T22:44:40.156896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:39.594853Z","title":"ElectricityLoadDiagrams20112014","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:39.594853Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:061e3b923c89d3f115e6b593e9815a2a2b57335e3c097a32fcd10c98456b886b","observation_id":"d1c5ca38-4526-459f-ad8e-fb9378444d07","resolution":{"observed_at":"2026-08-11T22:44:39.594853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.089663Z","title":"Decoupled weight decay regular- ization","venue":null,"work_id":"ba887493-3ae2-4571-b11b-cee636fb030a","year":2019},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:39.644854Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:62851b5cea3491448b893f81006ba3f57e266a45b814b8588c2596ba0c825c86","observation_id":"d9c4f5a0-173a-4172-9f57-92be4b891bd2","resolution":{"observed_at":"2026-08-11T22:44:40.124750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":1,"verified_fuzzy":37},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2412.03214."}