{"as_of":"2026-08-11T13:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6d03b7616865e83281b031b3502eaaef18bcbed19542f2acca7fb3502ec23045","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T00:33:24.906992Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.07616/citation-record","integrity":"/paper/2608.07616/integrity","json":"/paper/2608.07616/citation-record.json","paper":"/paper/2608.07616"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1902.06426","last_updated":"2019-02-21T17:01:02Z","snapshot_observed_at":"2026-08-07T15:18:47.460768Z","submitted_at":"2019-02-18T07:08:36Z","title":"2017 Robotic Instrument Segmentation Challenge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.06426","snapshot_observed_at":"2026-08-11T00:33:23.426911Z","title":"2017 robotic instrument segmentation challenge.arXiv preprint arXiv:1902.06426, 2019","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:23.426911Z"},"links":{"cited_paper":"/paper/1902.06426","citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:57da33a921fcd8ff1b760a319136400dc470fe3161bebf2f923072fb0a8836a2","observation_id":"89f35159-23f7-42ae-bf3b-8f706438b4d1","resolution":{"observed_at":"2026-08-11T00:33:23.426911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:27.916057Z","title":"Diagnostic assessment of deep learning algorithms for detection of lymph node metastases in women with breast cancer.JAMA, 318(22):2199–2210, 2017","venue":null,"work_id":"f6b636e3-dfe6-4353-8104-867fe0fcde8e","year":2017},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:23.450995Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:131bdaed659c7c828f3f4b06b19953c6ebb76379dc8f873c99e9602bff32887d","observation_id":"d25db0cf-c7e0-47eb-8cac-c14828fcb345","resolution":{"observed_at":"2026-08-11T00:33:27.919585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-11T00:33:23.476743Z","title":"Longformer: The long-document transformer.arXiv preprint arXiv:2004.05150, 2020","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:23.476743Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:122a54fd6fa6408c26ab1c6f7e66bbc1a2f1d8d6e4404e318216f7e5512afb5d","observation_id":"e92f340b-2215-4726-af84-dbf9b68878ef","resolution":{"observed_at":"2026-08-11T00:33:23.476743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:23.515924Z","title":"Efficientvit: Lightweight multi-scale attention for high-resolution dense prediction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:23.515924Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:3f14c9ec9e5fbbb9eba2ba6537983a9f30e2aebac2250baf3dcc2479418cd11d","observation_id":"05b0eada-8035-47d6-963f-af6af1179fc3","resolution":{"observed_at":"2026-08-11T00:33:23.515924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:27.904111Z","title":"Swin-UNet: Unet-like pure transformer for medical image segmenta- tion","venue":null,"work_id":"b35de567-471c-41f4-aab4-73d145896d3e","year":2022},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:23.544162Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:c379dbf3e0a39202bd4fc51a9208c9a712e1e789abb58b3b40239f1d2262e51d","observation_id":"1959458f-d32e-4efb-a929-ae4ef071bab7","resolution":{"observed_at":"2026-08-11T00:33:27.906691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.04306","last_updated":"2021-02-08T16:10:50Z","snapshot_observed_at":"2026-08-10T02:39:10.770770Z","submitted_at":"2021-02-08T16:10:50Z","title":"TransUNet: Transformers Make Strong Encoders for Medical Image Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.04306","snapshot_observed_at":"2026-08-11T00:33:23.564890Z","title":"TransUNet: Transformers make strong encoders for medical image segmentation.arXiv preprint arXiv:2102.04306, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:23.564890Z"},"links":{"cited_paper":"/paper/2102.04306","citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:c417e234abf754c9f0b0c199c19cd09ac8cadf62e29bbe56ca438d7870c0d02b","observation_id":"732a3df9-a568-49f0-8812-e7d659a01c40","resolution":{"observed_at":"2026-08-11T00:33:23.564890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05587","last_updated":"2017-12-05T18:06:21Z","snapshot_observed_at":"2026-08-07T13:44:53.690521Z","submitted_at":"2017-06-17T22:48:57Z","title":"Rethinking Atrous Convolution for Semantic Image Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.05587","snapshot_observed_at":"2026-08-11T00:33:23.588209Z","title":"Re- thinking atrous convolution for semantic image segmentation, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:23.588209Z"},"links":{"cited_paper":"/paper/1706.05587","citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:45da9f43bb2c845ac648d83e0e39b65fa5ac1e32802313e85bfdc45c282b0d84","observation_id":"ac0a4fc5-f991-4abe-b6ca-6c41a398acc3","resolution":{"observed_at":"2026-08-11T00:33:23.588209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:27.896258Z","title":null,"venue":null,"work_id":"4a4f025b-07ec-43e9-8cd2-7d6cc9714227","year":2023},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:23.616313Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:a42eb3204354c98138933b4b41c5b2ce5916580eff894a37cadb051025379293","observation_id":"5d8eb94d-b7ea-4543-b1b1-de0ce0e3acb2","resolution":{"observed_at":"2026-08-11T00:33:27.899206Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06373","last_updated":"2024-02-23T03:55:16Z","snapshot_observed_at":"2026-08-05T22:16:47.314849Z","submitted_at":"2023-03-11T10:44:44Z","title":"Recursive Generalization Transformer for Image Super-Resolution","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.06373","snapshot_observed_at":"2026-08-11T00:33:23.634112Z","title":"Recursive generalization transformer for image super-resolution.arXiv preprint arXiv:2303.06373, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:23.634112Z"},"links":{"cited_paper":"/paper/2303.06373","citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:7dfded81d4656b20d79ba05ee21a54cab01ec07bec0f2ba1ab296634fd14a25a","observation_id":"d50f9334-ca06-49d8-8200-1ecfaa56cbae","resolution":{"observed_at":"2026-08-11T00:33:23.634112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-09T19:46:04.857927Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-11T00:33:23.665860Z","title":"Generating long sequences with sparse transformers.arXiv preprint arXiv:1904.10509, 2019","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:23.665860Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:a41b0fa883e896b2a3ee8619862a3cd22a13d548d0d57449815bd5760963fc7b","observation_id":"09f27756-8a4f-49ce-a322-670b4a9e1ee1","resolution":{"observed_at":"2026-08-11T00:33:23.665860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:27.863613Z","title":"Choromanski, Valerii Likhosherstov, David Dohan, Xingyou Song, Georgiana-Andreea Gane, Tamas Sarlos, Peter Hawkins, Jared Q","venue":null,"work_id":"186aeba0-0746-42d3-aed4-b3228859b453","year":2021},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:23.697027Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:c17ed33abab43d9711b5b9afa1778a88f6115922550c246d152288751c6f86ee","observation_id":"a353df19-b9f8-453e-9eff-a538de9296b5","resolution":{"observed_at":"2026-08-11T00:33:27.884480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:27.814993Z","title":"The cityscapes dataset for semantic urban scene understanding","venue":null,"work_id":"be19a9ce-09b2-46d3-9975-4e5ea9132ec9","year":2016},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:23.718706Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:ebf766c9376ea309b71462d15d7e057a6e4ba5779a7f9bce3113d1a106b974aa","observation_id":"aa2fd4ff-46ee-414d-b956-36b235c9f394","resolution":{"observed_at":"2026-08-11T00:33:27.841576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:23.727442Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:23.727442Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:4e7aff65eab40f74768b1bdcd9113e4550f968a38980f34f6674bab3fb6e7b0f","observation_id":"a44e2a9e-4e66-4dc9-be96-a881aeb45b7c","resolution":{"observed_at":"2026-08-11T00:33:23.727442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T00:33:23.736858Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.arXiv preprint arXiv:2010.11929, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:23.736858Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:75a6fd117396e14b6e51b1e031d56da0d0b65e16702e943e5fe364ab244d497c","observation_id":"ac4ebd42-624b-41f5-ac4a-4173848143f2","resolution":{"observed_at":"2026-08-11T00:33:23.736858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:26.585507Z","title":"Segnext: Rethinking convolutional attention design for semantic segmen- tation.Advances in neural information processing systems, 35:1140–1156, 2022","venue":null,"work_id":"94c2326e-19c5-4e56-b68c-71f4f7d1a8ad","year":2022},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:23.758977Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:c5c2a2a6bfe01c9f28ba6debdaef5e02097dbe2e56719170437fde390637a515","observation_id":"70d7537c-98d6-409b-aec3-b14af91f5783","resolution":{"observed_at":"2026-08-11T00:33:27.771086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:26.576736Z","title":"Re- conFormer: Accelerated MRI reconstruction using recurrent transformer.IEEE Trans","venue":null,"work_id":"87e03e98-35e7-415b-a251-07c7469b31f9","year":2024},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:23.785735Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:41c33ab3bab6bfeaef6c0e5d071f96ded965a8d10ac1732733a2f8cdb16e58f1","observation_id":"69dc6777-d514-4aee-93c7-4731c4aecb6f","resolution":{"observed_at":"2026-08-11T00:33:26.579575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06189","last_updated":"2024-04-01T19:14:25Z","snapshot_observed_at":"2026-08-04T20:27:15.995220Z","submitted_at":"2023-06-09T18:41:37Z","title":"FasterViT: Fast Vision Transformers with Hierarchical Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.06189","snapshot_observed_at":"2026-08-11T00:33:23.807785Z","title":"Fastervit: Fast vision transformers with hierarchical attention.arXiv preprint arXiv:2306.06189, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:23.807785Z"},"links":{"cited_paper":"/paper/2306.06189","citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:da2eda9b71a83997e93906e6ff7a08620c4e5a26984bc348a1885e08e0f6fa2d","observation_id":"d40d8011-7c68-4e12-b17a-38d8e218588f","resolution":{"observed_at":"2026-08-11T00:33:23.807785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:26.568661Z","title":"Trans- formers are rnns: Fast autoregressive transformers with linear attention","venue":null,"work_id":"d3306e3b-d860-4178-9919-49d7b0a7c052","year":2020},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:23.843402Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:c9eeeec6d01b09e06ab7f4cbbc1dc1c095b4f6e4fbed0adef0b8cfee9f0ce71e","observation_id":"c82352e0-1d89-4ced-ad06-b9205c8bab5c","resolution":{"observed_at":"2026-08-11T00:33:26.571984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04451","last_updated":"2020-02-18T16:01:18Z","snapshot_observed_at":"2026-07-06T08:50:12.690900Z","submitted_at":"2020-01-13T18:38:28Z","title":"Reformer: The Efficient Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.04451","snapshot_observed_at":"2026-08-11T00:33:23.864382Z","title":"Reformer: The efficient trans- former.arXiv preprint arXiv:2001.04451, 2020","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:23.864382Z"},"links":{"cited_paper":"/paper/2001.04451","citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:9a8dd4df0fda74aa118a2f5a6af44033b8dc78a1e5ed40921005a50c7c17cea8","observation_id":"9edf679e-ca4f-4084-9b29-ba5bfff07de4","resolution":{"observed_at":"2026-08-11T00:33:23.864382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:26.557874Z","title":"Langerak, and Arno Klein","venue":null,"work_id":"9ef8cd08-022c-4acb-b16e-7dfe5624bacf","year":2015},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:23.897568Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:8f8e04ce36b7ee958dc28e11502078f86f38fe16936f2ce3198e16e81f96270d","observation_id":"a28f2204-bb89-41f4-854d-b94d0658ca96","resolution":{"observed_at":"2026-08-11T00:33:26.562709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:26.537028Z","title":"Efficientformer: Vision transformers at mobilenet speed","venue":null,"work_id":"4fa2e76e-74b4-462e-9187-492f8ef06433","year":2022},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:23.948071Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:e6e76b1f2eda57661193810773ce6931f61a9ed972e6510e9daeca1d3a14fd67","observation_id":"75cd9b47-35cb-4417-8676-4a4ce304c074","resolution":{"observed_at":"2026-08-11T00:33:26.541821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:26.526597Z","title":"Not all patches are what you need: Expediting vision transformers via token reorgani- zations","venue":null,"work_id":"13ed9028-598c-458f-8dd8-3e765839eeaf","year":2022},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:23.972336Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:5e76590fbf673f662d4b8bfccd034ce378118ee32b8ecc7d1c2636bfc8cb30b2","observation_id":"76d1a670-c6b9-4337-8fa1-7edbb474bf85","resolution":{"observed_at":"2026-08-11T00:33:26.531885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:26.502541Z","title":"Tinyserve: Query-aware cache selection for efficient llm serving","venue":null,"work_id":"4df7454f-281e-49e2-a8de-f530bfff1815","year":2025},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:23.987787Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:eea24f174d33c783ec6c84cc6a452e6abcaac69b1d4817bab20840b439e92ceb","observation_id":"9d953b55-9651-43ee-9f89-cc80f3b425cd","resolution":{"observed_at":"2026-08-11T00:33:26.507248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06526","last_updated":"2026-05-19T16:34:08Z","snapshot_observed_at":"2026-07-06T22:10:11.873662Z","submitted_at":"2025-08-02T03:50:14Z","title":"PiKV: KV Cache Management System for Mixture of Experts","version":3},"cited_work":{"arxiv_id":"2508.06526","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06526","snapshot_observed_at":"2026-08-11T00:33:25.348138Z","title":"PiKV: KV Cache Management System for Mixture of Experts","venue":"cs.DC","work_id":"c1008abf-5ec8-4af4-9f33-bc89bd77a6ca","year":2025},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.037166Z"},"links":{"cited_paper":"/paper/2508.06526","citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:7b12f09470911c9819e6ca25db00bff9aa91b2e7056fba002808094d2fb1d47a","observation_id":"612ab843-403f-4337-b9fb-c28049379792","resolution":{"observed_at":"2026-08-11T00:33:25.370855Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:24.088427Z","title":"Fast- cache: Fast caching for diffusion transformer through learnable linear approximation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.088427Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:44d18fd3f2a0317a859614f9c3465a172b30ab5c34acdf00fc805c678d98b673","observation_id":"9313d929-4336-4600-ace1-3913ed9502fc","resolution":{"observed_at":"2026-08-11T00:33:24.088427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:26.461547Z","title":"To keep or not to keep: Learning KV cache retention in disaggregated LLM serving systems","venue":null,"work_id":"edfdd888-d976-4dc7-a30c-910b868454c5","year":2026},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.119516Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:3e9cbf7412e4a1e600369368b4a4c185de934c56b1f51e96849d276381ee516b","observation_id":"2f81fcd4-ea72-487d-964e-4d08c59f5bca","resolution":{"observed_at":"2026-08-11T00:33:26.488458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.13357","last_updated":"2026-08-05T03:37:20Z","snapshot_observed_at":"2026-08-11T02:11:26.768816Z","submitted_at":"2026-02-13T08:11:54Z","title":"AdaCorrection: Adaptive Offset Cache Correction for Accurate Diffusion Transformers","version":3},"cited_work":{"arxiv_id":"2602.13357","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.13357","snapshot_observed_at":"2026-08-11T00:33:25.232233Z","title":"AdaCorrection: Adaptive Offset Cache Correction for Accurate Diffusion Transformers","venue":"cs.CV","work_id":"8825391d-f0dd-4f36-952b-57eb9fcfc286","year":2026},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.156610Z"},"links":{"cited_paper":"/paper/2602.13357","citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:607eaa27429f7ec7daa73d9926399b0ad60e43e3daf5ed8279d46c52de987d2a","observation_id":"a8c9af71-2a91-4510-b6d2-522cd0bafb2e","resolution":{"observed_at":"2026-08-11T00:33:25.250526Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:26.410978Z","title":"Mka: Memory-keyed attention for efficient long-context reasoning","venue":null,"work_id":"35649398-942b-4ab7-9ccb-fad8f87fd3de","year":2026},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.183432Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:ef9a8dc02fd5a954c636bf181fed187c7c9849ced579f2aaa2899ad463dbe9a0","observation_id":"24d3e294-1f88-48c1-8a3d-9356eb9e26f9","resolution":{"observed_at":"2026-08-11T00:33:26.426242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.22901","last_updated":"2026-04-24T13:56:55Z","snapshot_observed_at":"2026-08-11T08:21:01.229972Z","submitted_at":"2026-04-24T13:56:55Z","title":"Accelerating Frequency Domain Diffusion Models with Error-Feedback Event-Driven Caching","version":1},"cited_work":{"arxiv_id":"2604.22901","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.22901","snapshot_observed_at":"2026-08-11T00:33:25.160246Z","title":"Accelerating Frequency Domain Diffusion Models with Error-Feedback Event-Driven Caching","venue":"cs.LG","work_id":"47318ea5-96a0-466d-b7b3-fd0d9f76fe61","year":2026},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.188624Z"},"links":{"cited_paper":"/paper/2604.22901","citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:8c3c9a2e79dd2cc05c16dbad16649f90f81c495620d6c99210740cd9262671af","observation_id":"1d5ceffc-c3f1-4a12-93dd-39fa419be2f4","resolution":{"observed_at":"2026-08-11T00:33:25.198855Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10166","last_updated":"2024-12-29T14:57:13Z","snapshot_observed_at":"2026-07-06T17:17:31.008185Z","submitted_at":"2024-01-18T17:55:39Z","title":"VMamba: Visual State Space Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10166","snapshot_observed_at":"2026-08-11T00:33:24.235308Z","title":"Vmamba: Visual state space model.arXiv preprint arXiv:2401.10166, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.235308Z"},"links":{"cited_paper":"/paper/2401.10166","citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:68c1c4f1fc7b349b25b9be3c243e4c1b83433dc21522ba69df1aed6d4137d1e7","observation_id":"e91c1b11-b66d-49e5-8f0b-fba13f1f3647","resolution":{"observed_at":"2026-08-11T00:33:24.235308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:24.264680Z","title":"Swin transformer: Hierarchical vision transformer using shifted win- dows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.264680Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:72a6bbef328964a6346d293f6a08625ae11895af218203fda505c77a21595ec5","observation_id":"6818d1f8-7886-4f46-a01c-f82676cd152a","resolution":{"observed_at":"2026-08-11T00:33:24.264680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:24.291115Z","title":"A convnet for the 2020s","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.291115Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:594a5b360dda2be714049ac9b36b27915bd97e5c91bcd66d68ccf4ce74547e75","observation_id":"08d083f6-b882-464c-99aa-3f9e821d10fa","resolution":{"observed_at":"2026-08-11T00:33:24.291115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:26.355873Z","title":"MobileViT: Light-weight, general-purpose, and mobile-friendly vision transformer","venue":null,"work_id":"514eba5a-35b5-4bc2-8ed2-68616362b8c9","year":2022},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.329924Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:6c8eba1b83b5de6697dece07f58776bbc16e5a91ffefd6d82134284f8e2db8f5","observation_id":"8b3681f4-768a-4eff-a38e-7805f832f2c8","resolution":{"observed_at":"2026-08-11T00:33:26.382228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:26.237370Z","title":"Adavit: Adaptive vision transformers for efficient image recogni- tion","venue":null,"work_id":"97e0a842-6a36-4802-959a-d00f85aa3f25","year":2022},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.359689Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:dec2080586964ecd3eb429ca0f47c147e0957ea90d38e1970428f9d256b1a8e3","observation_id":"f901de8e-292e-4898-9324-4467406690c0","resolution":{"observed_at":"2026-08-11T00:33:26.308561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.02867","last_updated":"2018-07-28T06:51:27Z","snapshot_observed_at":"2026-07-06T06:37:55.065033Z","submitted_at":"2018-05-08T07:34:17Z","title":"Online normalizer calculation for softmax","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.02867","snapshot_observed_at":"2026-08-11T00:33:24.366577Z","title":"Online normalizer calculation for softmax","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.366577Z"},"links":{"cited_paper":"/paper/1805.02867","citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:75c04c4355e789c0675716521ffdb3564285d9c9fa36933aa94ba4942efecdab","observation_id":"484a9d59-4de3-41fb-a3fb-e54043cfed2b","resolution":{"observed_at":"2026-08-11T00:33:24.366577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.02143","last_updated":"2021-03-19T21:24:06Z","snapshot_observed_at":"2026-08-04T23:37:38.910806Z","submitted_at":"2021-03-03T02:48:56Z","title":"Random Feature Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.02143","snapshot_observed_at":"2026-08-11T00:33:24.407493Z","title":"Random feature attention.arXiv preprint arXiv:2103.02143, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.407493Z"},"links":{"cited_paper":"/paper/2103.02143","citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:df77070bbc2f5957cafb66f1f5818d889465a97d5191dada78ead43a00e1cfe2","observation_id":"9216f8d3-bb74-42ac-b122-98a6f79db7a7","resolution":{"observed_at":"2026-08-11T00:33:24.407493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:26.109019Z","title":"Dynamicvit: Efficient vision transformers with dynamic token sparsification","venue":null,"work_id":"86b72749-48aa-4358-a439-fc229c729777","year":2021},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.444797Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:95069a365b63b9704bd747cdaeb7b6b78b63af29756029a4143715b24f474ede","observation_id":"2eb55a57-09f8-4c3a-ba3d-be0142f81c63","resolution":{"observed_at":"2026-08-11T00:33:26.159708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:26.100963Z","title":null,"venue":null,"work_id":"7fa66494-a393-48b6-a455-7abac5df30a3","year":2017},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.474942Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:cdc2fba05923a090cefe3e34d3da80b9f17e5922a6810a8d8401404b6619b217","observation_id":"a91c10eb-b7ba-486b-bf02-8d166847710d","resolution":{"observed_at":"2026-08-11T00:33:26.103613Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:26.074298Z","title":"Efficient attention: Attention with linear complexities","venue":null,"work_id":"6d76b07c-073f-4d8b-bc1f-fa048ba044aa","year":2021},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.508936Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:1a35dfae442a365d194e3742f9031749f9cfcfc6308efe374e72035b49ac4bbe","observation_id":"1cf25b3c-5f51-4c32-920d-42cd13dc04be","resolution":{"observed_at":"2026-08-11T00:33:26.095307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:26.048286Z","title":"Ntire 2017 challenge on single image super-resolution: Methods and results","venue":null,"work_id":"f07fe949-e654-4b26-ae99-a127ab16c344","year":2017},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.555087Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:aca684d1476a17883521c7c91c595e0c03e7e6d245f6fa9773c34123aca5bc5b","observation_id":"9ee6cdaf-b707-4c53-96e5-d064ea85992d","resolution":{"observed_at":"2026-08-11T00:33:26.055128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:26.009125Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"3534cc11-37f2-4bbb-a7c5-77348c088ab4","year":2021},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.575457Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:68fc8f7f740f3fddfd0084d4f4184fdf1c90b2196c4879d5323a95f623a0e81d","observation_id":"74a67419-fd6f-47e1-8723-70647252a277","resolution":{"observed_at":"2026-08-11T00:33:26.031269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:25.980175Z","title":"Med- ical transformer: Gated axial-attention for medical image segmentation","venue":null,"work_id":"b0a52878-f3ae-4752-bf87-d3b0e2e104af","year":2021},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.578405Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:b2fe408446e01b871cee3e494f2817a923b8d7e046f4da05b987676fd3952664","observation_id":"6b7a07b3-ecb4-4e0b-a37f-c19626663700","resolution":{"observed_at":"2026-08-11T00:33:25.992578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.acl-main.686","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:24.941690Z","title":"HAT: Hardware-aware transformers for efficient natural language process- ing","venue":null,"work_id":"57f4f34a-88a3-4c4c-994b-1ab6fef6dcca","year":2020},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.582727Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:e289d6315ee1b66c082cfc324cfe893c088c3a023d78d6a600ac3f3079831539","observation_id":"9273aa99-fe26-4af3-9610-a38c43925136","resolution":{"observed_at":"2026-08-11T00:33:24.972418Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:25.938411Z","title":"SpAtten: Efficient sparse attention ar- chitecture with cascade token and head pruning","venue":null,"work_id":"5faadb7f-08c2-49ec-91b1-2a0263c95617","year":null},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.591528Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:7eb0f4ff42c649fb2047fed5418c7e879a6864b93be7da7fade3a6fa898e0395","observation_id":"900fefaf-19b1-4f41-8f82-0f2e47c1f1a5","resolution":{"observed_at":"2026-08-11T00:33:25.959746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-08-11T00:33:24.614529Z","title":"Linformer: Self-attention with linear complexity.arXiv preprint arXiv:2006.04768, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.614529Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:a9dc8babc23c6ef7d729713f72b5f94bde9090346444e0d5bad1401fc0d614a5","observation_id":"832e0bbb-235f-40ed-99f6-95c6617d3fca","resolution":{"observed_at":"2026-08-11T00:33:24.614529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:24.645635Z","title":"Pyramid vision transformer: A versatile backbone for dense prediction without convolutions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.645635Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:01aa230e1f5fc529b898e032075cbe71eed10a05e41e8e92fea6eb1accfbcfba","observation_id":"05dd2c18-75e1-491d-bea4-54283f6fa649","resolution":{"observed_at":"2026-08-11T00:33:24.645635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:25.884813Z","title":"Segformer: Simple and efficient design for semantic segmentation with trans- formers.Advances in neural information processing systems, 34:12077–12090, 2021","venue":null,"work_id":"803dc5f9-ef5c-43ca-afd6-b8606802c50a","year":2021},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.660800Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:5bfcdad1b834dd9a9277b68dee0456e271a63a11d1a1b27286b9fd2a2df17b86","observation_id":"90fc97b9-d64d-428e-810c-98aa245a3acb","resolution":{"observed_at":"2026-08-11T00:33:25.915274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:25.830006Z","title":"Nyströmformer: A nyström-based algorithm for approximat- ing self-attention.Proceedings of the AAAI conference on artificial intelligence, 35 (16):14138–14148, 2021","venue":null,"work_id":"dc981353-a20c-47ac-8032-14bcd9844502","year":2021},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.691642Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:5030bc4b92e9d0f9ec7a90dc27952c8f0568ad234766740d50324a76dd74561d","observation_id":"7fcf4dc4-0b88-4222-9d9f-acd7cb7cb3a1","resolution":{"observed_at":"2026-08-11T00:33:25.852502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:25.757521Z","title":"Evo-vit: Slow-fast token evolution for dynamic vision transformer","venue":null,"work_id":"6107923b-9b07-4ead-bf0a-73d019018284","year":2022},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.727006Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:e06ff3e4b48afc88780fff39e48784422d91824ede1e2f2e3e78f9edf36a3179","observation_id":"c9a5b3f2-4068-4c5b-8efa-f114238b4ba3","resolution":{"observed_at":"2026-08-11T00:33:25.798336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:25.689783Z","title":"A-vit: Adaptive tokens for efficient vision transformer","venue":null,"work_id":"91bd1918-acaf-47c6-b6aa-9c4b84f33221","year":2022},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.763041Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:660704cecd2b471208b3f80accd2c019111edbed3360722f6206c92d349aaf81","observation_id":"b24f8e56-3d78-4239-aaba-74bb01e8c37a","resolution":{"observed_at":"2026-08-11T00:33:25.724579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:25.611954Z","title":"Coprimeeeg: Crt-guided dual-branch reconstruction from co-prime sub-nyquist eeg","venue":null,"work_id":"9885a90e-6a2d-4527-8c2a-b2858b137c5d","year":2026},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.779988Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:bad44be2001bc8acc5b193f217c0e41dd88fbb7fc6aebe110f7cad419e944649","observation_id":"488f1994-7aa7-4478-8204-4689cf6590f4","resolution":{"observed_at":"2026-08-11T00:33:25.648303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:25.557588Z","title":"Big bird: Transformers for longer sequences.Advances in neural information process- ing systems, 33:17283–17297, 2020","venue":null,"work_id":"a7a9c762-52cd-42dd-b639-80b58d6b5abd","year":2020},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.790918Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:860b20c68e985bfa29a47265dc350cea269275af772fcc2e614176a83d57d7a4","observation_id":"7fd04453-0109-4f79-aafe-759597061a67","resolution":{"observed_at":"2026-08-11T00:33:25.585576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:24.828336Z","title":"Restormer: Efficient transformer for high-resolution image restoration","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.828336Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:f8ab11d0f801cedb761d6b9329904cea57cb6a4cf670f1443cf183deb307e433","observation_id":"8aa06234-651b-457d-bf11-5f6fd5ce144a","resolution":{"observed_at":"2026-08-11T00:33:24.828336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:24.850748Z","title":"Pyramid scene parsing network","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.850748Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:ae600a8f9b0d7654de635d3281b344914c96d71fd611b3981099bddc6a6c82ca","observation_id":"db41cb7a-74e5-4231-8173-84028473a424","resolution":{"observed_at":"2026-08-11T00:33:24.850748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:25.486701Z","title":"PSANet: Point-wise spatial attention network for scene parsing","venue":null,"work_id":"ac552c0f-262a-4247-a368-75dc1182acd5","year":2018},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.873519Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:6fcc6855c5f5b74831477fc5142af7b79b0471444cad0e05f6bd180085b78235","observation_id":"d4851a68-2360-493f-9ea6-8ec02be81674","resolution":{"observed_at":"2026-08-11T00:33:25.509925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:25.479549Z","title":"Scene parsing through ade20k dataset","venue":null,"work_id":"c66da253-9ead-45f6-9e2d-b6a63f4d8a00","year":2017},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.889742Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:8b0168a0e35f26ea14a8cb0726fa4a537073ee71d74344bad6d29b702bae77b1","observation_id":"705c0464-7b82-4334-9bce-fb43511d2ab1","resolution":{"observed_at":"2026-08-11T00:33:25.482325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:25.462247Z","title":"Biformer: Vision transformer with bi-level routing attention.Proceedings of the IEEE/CVF con- ference on computer vision and pattern recognition, pages 10323–10333, 2023","venue":null,"work_id":"7a1a82d6-3b52-4c6d-9727-2cec931ccf47","year":2023},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.906992Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:351e0a19c7848592c337809203ff392cea86b9e1dffd49c95495fed4e1012505","observation_id":"115300b9-5169-499e-9cc4-65634dfde920","resolution":{"observed_at":"2026-08-11T00:33:25.473705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:33:24.599288Z","title":"URLhttps://doi.org/10","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T00:33:24.599288Z"},"links":{"citing_paper":"/paper/2608.07616"},"observation_digest":"sha256:83cb23b734ed6f7ba98e614ec7a3021ec39f905e883a8c9dac6ca3628b05f6c8","observation_id":"b4abb9bf-f6d5-4ba3-b185-a71010cd11c0","resolution":{"observed_at":"2026-08-11T00:33:24.599288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.07616","last_updated":"2026-08-07T03:47:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T13:15:42.996188Z","submitted_at":"2026-08-07T03:47:04Z","title":"HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":4,"verified_fuzzy":30},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2608.07616."}