{"as_of":"2026-08-08T19:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:44e802318a683cd372e9687f083c982aedccf55ef70ec1e29e9b4cd0c6a266f9","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T19:49:11.774586Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.11921/citation-record","integrity":"/paper/2508.11921/integrity","json":"/paper/2508.11921/citation-record.json","paper":"/paper/2508.11921"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.18668","last_updated":"2025-03-07T18:57:52Z","snapshot_observed_at":"2026-07-06T17:37:05.339368Z","submitted_at":"2024-02-28T19:28:27Z","title":"Simple linear attention language models balance the recall-throughput tradeoff","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18668","snapshot_observed_at":"2026-08-05T19:49:10.064645Z","title":"Simple linear attention language models balance the recall-throughput tradeoff","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11921","last_updated":"2025-08-16T05:55:51Z","snapshot_observed_at":"2026-08-06T19:54:41.569424Z","submitted_at":"2025-08-16T05:55:51Z","title":"ENA: Efficient N-dimensional Attention","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T19:49:10.064645Z"},"links":{"cited_paper":"/paper/2402.18668","citing_paper":"/paper/2508.11921"},"observation_digest":"sha256:ce8eae5bf6a8a75e8a2278889a990aab1649ebcbaa5f97f7906d6a8361048430","observation_id":"ef71d323-3fbe-4f32-a902-cccd8ff3a445","resolution":{"observed_at":"2026-08-05T19:49:10.064645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-05T19:49:10.434135Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11921","last_updated":"2025-08-16T05:55:51Z","snapshot_observed_at":"2026-08-06T19:54:41.569424Z","submitted_at":"2025-08-16T05:55:51Z","title":"ENA: Efficient N-dimensional Attention","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T19:49:10.434135Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2508.11921"},"observation_digest":"sha256:299f8e3815ec6fb0ba4e69986e9b537b28217128036deffe001f07f10054affb","observation_id":"7409a641-8b0f-4cc4-b2be-94bdd7918dff","resolution":{"observed_at":"2026-08-05T19:49:10.434135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:49:10.529649Z","title":"Ali Hassani, Steven Walton, Jiachen Li, Shen Li, and Humphrey Shi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11921","last_updated":"2025-08-16T05:55:51Z","snapshot_observed_at":"2026-08-06T19:54:41.569424Z","submitted_at":"2025-08-16T05:55:51Z","title":"ENA: Efficient N-dimensional Attention","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T19:49:10.529649Z"},"links":{"citing_paper":"/paper/2508.11921"},"observation_digest":"sha256:5c3d60303767426089888004c6e9e4dcc684461ddc807dbd43a19388f6baff32","observation_id":"5932ed19-ccd3-4de4-b488-6cfb120f572a","resolution":{"observed_at":"2026-08-05T19:49:10.529649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08083","last_updated":"2025-03-25T17:54:37Z","snapshot_observed_at":"2026-08-06T23:38:21.068023Z","submitted_at":"2024-07-10T23:02:45Z","title":"MambaVision: A Hybrid Mamba-Transformer Vision Backbone","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08083","snapshot_observed_at":"2026-08-05T19:49:10.658797Z","title":"Mambavision: A hybrid mamba-transformer vision backbone","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11921","last_updated":"2025-08-16T05:55:51Z","snapshot_observed_at":"2026-08-06T19:54:41.569424Z","submitted_at":"2025-08-16T05:55:51Z","title":"ENA: Efficient N-dimensional Attention","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T19:49:10.658797Z"},"links":{"cited_paper":"/paper/2407.08083","citing_paper":"/paper/2508.11921"},"observation_digest":"sha256:a1e4e5789a0c274ef1e8debe922e309b62bc3b873923ef44c3990393fb2241b8","observation_id":"e1fa40ad-2c2b-4978-9a12-641e8daa6508","resolution":{"observed_at":"2026-08-05T19:49:10.658797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-07-06T13:15:58.303738Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-05T19:49:10.759726Z","title":"Cogvideo: Large-scale pre- training for text-to-video generation via transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11921","last_updated":"2025-08-16T05:55:51Z","snapshot_observed_at":"2026-08-06T19:54:41.569424Z","submitted_at":"2025-08-16T05:55:51Z","title":"ENA: Efficient N-dimensional Attention","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T19:49:10.759726Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2508.11921"},"observation_digest":"sha256:fa25e9ae15cc93f11fa35d7abddf762f18652034619f5ecb087f509cdf257092","observation_id":"f2728015-6764-493f-b783-2204843fea74","resolution":{"observed_at":"2026-08-05T19:49:10.759726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-05T19:49:10.995232Z","title":"Rwkv: Reinventing rnns for the transformer era","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11921","last_updated":"2025-08-16T05:55:51Z","snapshot_observed_at":"2026-08-06T19:54:41.569424Z","submitted_at":"2025-08-16T05:55:51Z","title":"ENA: Efficient N-dimensional Attention","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T19:49:10.995232Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2508.11921"},"observation_digest":"sha256:fb7621242ee332d8fde0f8fe52ed7bba6737940c65a199ce4e1f55e4b13961a5","observation_id":"f6539178-16bf-4925-a449-451030c5d190","resolution":{"observed_at":"2026-08-05T19:49:10.995232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14456","last_updated":"2025-03-30T13:46:44Z","snapshot_observed_at":"2026-08-07T16:54:15.957609Z","submitted_at":"2025-03-18T17:31:05Z","title":"RWKV-7 \"Goose\" with Expressive Dynamic State Evolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14456","snapshot_observed_at":"2026-08-05T19:49:11.083164Z","title":"Rwkv-7” goose” with expressive dynamic state evolution","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11921","last_updated":"2025-08-16T05:55:51Z","snapshot_observed_at":"2026-08-06T19:54:41.569424Z","submitted_at":"2025-08-16T05:55:51Z","title":"ENA: Efficient N-dimensional Attention","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T19:49:11.083164Z"},"links":{"cited_paper":"/paper/2503.14456","citing_paper":"/paper/2508.11921"},"observation_digest":"sha256:e0b076b46597ee8d6016b82db482a91920c063587ef91cb827354a200616a66e","observation_id":"e4e509f6-a6d4-4e22-8b4a-d193b14ad195","resolution":{"observed_at":"2026-08-05T19:49:11.083164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:49:11.207261Z","title":"Benjamin F","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11921","last_updated":"2025-08-16T05:55:51Z","snapshot_observed_at":"2026-08-06T19:54:41.569424Z","submitted_at":"2025-08-16T05:55:51Z","title":"ENA: Efficient N-dimensional Attention","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T19:49:11.207261Z"},"links":{"citing_paper":"/paper/2508.11921"},"observation_digest":"sha256:33de15b36cc42b6128d13c771ea182fe918d6675fde01f69fcd0f3600b53e424","observation_id":"f577b9ad-6f32-4d67-833c-88464763088f","resolution":{"observed_at":"2026-08-05T19:49:11.207261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-05T19:49:11.286384Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11921","last_updated":"2025-08-16T05:55:51Z","snapshot_observed_at":"2026-08-06T19:54:41.569424Z","submitted_at":"2025-08-16T05:55:51Z","title":"ENA: Efficient N-dimensional Attention","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T19:49:11.286384Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2508.11921"},"observation_digest":"sha256:bf967cb5ad04d0ff9040ccbe18da425082fb0fd5c7b0f2b02905d72d0b478a04","observation_id":"d826aa2d-4b72-4458-8c27-c16f006d823b","resolution":{"observed_at":"2026-08-05T19:49:11.286384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-05T19:49:11.400467Z","title":"Siglip 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11921","last_updated":"2025-08-16T05:55:51Z","snapshot_observed_at":"2026-08-06T19:54:41.569424Z","submitted_at":"2025-08-16T05:55:51Z","title":"ENA: Efficient N-dimensional Attention","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T19:49:11.400467Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2508.11921"},"observation_digest":"sha256:6c9a6c7417b56187f02d63e77ff31670681b8c7314c0e8bcf85ee8529d3be2a3","observation_id":"1520c3a0-57a7-41b3-88de-52608737d10f","resolution":{"observed_at":"2026-08-05T19:49:11.400467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05233","last_updated":"2026-06-03T16:16:54Z","snapshot_observed_at":"2026-08-07T10:20:00.883360Z","submitted_at":"2025-06-05T16:50:23Z","title":"MesaNet: Sequence Modeling by Locally Optimal Test-Time Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05233","snapshot_observed_at":"2026-08-05T19:49:11.512031Z","title":"Feng Wang, Timing Yang, Yaodong Yu, Sucheng Ren, Guoyizhe Wei, Angtian Wang, Wei Shao, Yuyin Zhou, Alan Yuille, and Cihang Xie","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11921","last_updated":"2025-08-16T05:55:51Z","snapshot_observed_at":"2026-08-06T19:54:41.569424Z","submitted_at":"2025-08-16T05:55:51Z","title":"ENA: Efficient N-dimensional Attention","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T19:49:11.512031Z"},"links":{"cited_paper":"/paper/2506.05233","citing_paper":"/paper/2508.11921"},"observation_digest":"sha256:c4668570db21d56cef2a101adda0c32e815238ef99c5eef081be1f68a6ae0719","observation_id":"b7f60119-3474-40f2-be41-e244f25896ee","resolution":{"observed_at":"2026-08-05T19:49:11.512031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-05T19:49:11.603155Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11921","last_updated":"2025-08-16T05:55:51Z","snapshot_observed_at":"2026-08-06T19:54:41.569424Z","submitted_at":"2025-08-16T05:55:51Z","title":"ENA: Efficient N-dimensional Attention","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T19:49:11.603155Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2508.11921"},"observation_digest":"sha256:cbcc3af5f8dc71984286cfb7ca4027a69ca05dc4459d794beb030f92f1c663da","observation_id":"6e9554dc-f494-46ec-b6c5-da77107e6a44","resolution":{"observed_at":"2026-08-05T19:49:11.603155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04507","last_updated":"2025-06-04T23:21:39Z","snapshot_observed_at":"2026-08-05T18:16:36.053313Z","submitted_at":"2025-02-06T21:17:09Z","title":"Fast Video Generation with Sliding Tile Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04507","snapshot_observed_at":"2026-08-05T19:49:11.691323Z","title":"Fast video generation with sliding tile attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11921","last_updated":"2025-08-16T05:55:51Z","snapshot_observed_at":"2026-08-06T19:54:41.569424Z","submitted_at":"2025-08-16T05:55:51Z","title":"ENA: Efficient N-dimensional Attention","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T19:49:11.691323Z"},"links":{"cited_paper":"/paper/2502.04507","citing_paper":"/paper/2508.11921"},"observation_digest":"sha256:e25496a859153103063c839c36c32c59ee26995bf3d37ef06dff3bd6682cb9b1","observation_id":"4eff0aab-b8dc-4c9f-bbd0-f285a89a97ba","resolution":{"observed_at":"2026-08-05T19:49:11.691323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18428","last_updated":"2024-11-26T16:42:34Z","snapshot_observed_at":"2026-07-06T18:21:30.595036Z","submitted_at":"2024-05-28T17:59:33Z","title":"DiG: Scalable and Efficient Diffusion Models with Gated Linear Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18428","snapshot_observed_at":"2026-08-05T19:49:11.774586Z","title":"Dig: Scalable and efficient diffusion models with gated linear attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11921","last_updated":"2025-08-16T05:55:51Z","snapshot_observed_at":"2026-08-06T19:54:41.569424Z","submitted_at":"2025-08-16T05:55:51Z","title":"ENA: Efficient N-dimensional Attention","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T19:49:11.774586Z"},"links":{"cited_paper":"/paper/2405.18428","citing_paper":"/paper/2508.11921"},"observation_digest":"sha256:9b6c927d223884facf56a294be4407ac21efc17d20d24b886dc8545a47fb6516","observation_id":"79275d62-3ddb-431c-8f58-a2206258d72e","resolution":{"observed_at":"2026-08-05T19:49:11.774586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-05T19:49:10.885504Z","title":"Songhua Liu, Zhenxiong Tan, and Xinchao Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11921","last_updated":"2025-08-16T05:55:51Z","snapshot_observed_at":"2026-08-06T19:54:41.569424Z","submitted_at":"2025-08-16T05:55:51Z","title":"ENA: Efficient N-dimensional Attention","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-05T19:49:10.885504Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2508.11921"},"observation_digest":"sha256:c2c6ffe6ced48cdcc9cd4db6118fe29335f6b9d6652ad409835a7e6be1188db2","observation_id":"b9275990-0f4d-4869-ae91-60cab976f278","resolution":{"observed_at":"2026-08-05T19:49:10.885504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05496","last_updated":"2024-12-07T01:46:38Z","snapshot_observed_at":"2026-08-07T15:28:16.662668Z","submitted_at":"2024-12-07T01:46:38Z","title":"Flex Attention: A Programming Model for Generating Optimized Attention Kernels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05496","snapshot_observed_at":"2026-08-05T19:49:10.340227Z","title":"Flex attention: A programming model for generating optimized attention kernels.arXiv preprint arXiv:2412.05496,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11921","last_updated":"2025-08-16T05:55:51Z","snapshot_observed_at":"2026-08-06T19:54:41.569424Z","submitted_at":"2025-08-16T05:55:51Z","title":"ENA: Efficient N-dimensional Attention","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T19:49:10.340227Z"},"links":{"cited_paper":"/paper/2412.05496","citing_paper":"/paper/2508.11921"},"observation_digest":"sha256:600e50eb4c54d23782d83e70dce3f784bfaaefe4c5196a42bace42ba498f2394","observation_id":"96f147a4-931c-44bc-a728-7df374eb3e08","resolution":{"observed_at":"2026-08-05T19:49:10.340227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05298","last_updated":"2025-04-07T17:56:31Z","snapshot_observed_at":"2026-08-07T16:07:51.376018Z","submitted_at":"2025-04-07T17:56:31Z","title":"One-Minute Video Generation with Test-Time Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05298","snapshot_observed_at":"2026-08-05T19:49:10.123461Z","title":"One-minute video generation with test-time training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11921","last_updated":"2025-08-16T05:55:51Z","snapshot_observed_at":"2026-08-06T19:54:41.569424Z","submitted_at":"2025-08-16T05:55:51Z","title":"ENA: Efficient N-dimensional Attention","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T19:49:10.123461Z"},"links":{"cited_paper":"/paper/2504.05298","citing_paper":"/paper/2508.11921"},"observation_digest":"sha256:e4ccb27097d9fdbe0646ac47ff191975dec415c1cc2267df9293334c58e889dc","observation_id":"681a9229-e1f3-4274-be17-a636b7f16f52","resolution":{"observed_at":"2026-08-05T19:49:10.123461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-05T19:49:10.254232Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11921","last_updated":"2025-08-16T05:55:51Z","snapshot_observed_at":"2026-08-06T19:54:41.569424Z","submitted_at":"2025-08-16T05:55:51Z","title":"ENA: Efficient N-dimensional Attention","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T19:49:10.254232Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2508.11921"},"observation_digest":"sha256:1a4a90ab8e991cfd9103edde3584a2a76af64369bf19b39db30e4f569fe9d7f7","observation_id":"7e023665-2a73-4c80-8a40-9b73275d8718","resolution":{"observed_at":"2026-08-05T19:49:10.254232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.11921","last_updated":"2025-08-16T05:55:51Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T19:54:41.569424Z","submitted_at":"2025-08-16T05:55:51Z","title":"ENA: Efficient N-dimensional Attention"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 0 inbound Pith citation observations for arXiv:2508.11921."}