{"as_of":"2026-08-07T07:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a2e17f9fea655513088dec3540ec4249eda1604778ac6f98e3ee696bf74a2cdd","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T03:24:08.548348Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.09385/citation-record","integrity":"/paper/2607.09385/integrity","json":"/paper/2607.09385/citation-record.json","paper":"/paper/2607.09385"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"AIOS: LLM Agent Operating System,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-07-15T23:18:13.183632Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:7feea25b0c5e0d1f2eaaccf439e3ddc21239f0319dfc61ed5a5bc09a2a25ef54","observation_id":"8f797521-39f6-4039-a6c6-7b6c7474d6f3","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07885","last_updated":"2026-05-21T03:40:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-11T06:33:30Z","title":"Intelligence per Watt: Measuring Intelligence Efficiency of Local AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.07885","snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"Intelligence per Watt: Measuring Intelligence Efficiency of Local AI,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-07-15T23:18:13.183632Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"cited_paper":"/paper/2511.07885","citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:0beeaeb8f1abfaa120cfccda5e2ca3f0653b862a38ce443d2a2825db98731dbc","observation_id":"6cabc7fb-7d3e-4737-bb29-1bfe8855bd16","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"A survey on privacy risks and protection in large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-07-15T23:18:13.183632Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:334173863012fc6684534835943236c15648123909a2b53700855464586f44b0","observation_id":"c86430ee-29e0-452a-bc8e-e86670bc3a88","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"AMD XDNA NPU in Ryzen AI Processors,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-07-15T23:18:13.183632Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:6829ab1c44261255c8cf1bfee80f0ea99adddad0e91e271bbae7fb287b131b7d","observation_id":"0169cce9-deab-44a9-8f4c-7623e2f15737","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16663","last_updated":"2024-10-22T03:29:33Z","snapshot_observed_at":"2026-08-07T00:29:14.945462Z","submitted_at":"2024-10-22T03:29:33Z","title":"FastAttention: Extend FlashAttention2 to NPUs and Low-resource GPUs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16663","snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"FastAttention: Extend FlashAttention2 to NPUs and Low-resource GPUs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-07-15T23:18:13.183632Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"cited_paper":"/paper/2410.16663","citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:3edccc47b2a59d035640a85e5bf037485d378cdc58221669973c9b162c55cb14","observation_id":"791d64a9-ac84-444e-b942-900736d56b01","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11053","last_updated":"2024-12-15T05:15:54Z","snapshot_observed_at":"2026-07-06T20:07:14.913902Z","submitted_at":"2024-12-15T05:15:54Z","title":"NITRO: LLM Inference on Intel Laptop NPUs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11053","snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"NITRO: LLM Inference on Intel Laptop NPUs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-07-15T23:18:13.183632Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"cited_paper":"/paper/2412.11053","citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:56344907ecc5dd69adedc108662a83d1a0b12f3c620ad877a11b1a1237aaaa4a","observation_id":"51625f01-9fe2-453c-8512-c5041da42fcb","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"LServe: Efficient Long-sequence LLM Serving with Unified Sparse Attention,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-07-15T23:18:13.183632Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:b933bf0cd39adacad4a6bc770e56d224ba15346ad179404f70bcd75a101ac64d","observation_id":"af5092ae-d8e8-4f46-86e4-7fe8a3f2fb01","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-07-15T23:18:13.183632Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:0370045a750ab8e297108f3e3ec573ef55a12699e8c9ef923623af4fa24dd010","observation_id":"2e0449c7-df1e-4cf9-bb57-244104506728","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"ITA: An Energy-Efficient Attention and Softmax Accelerator for Quantized Transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-07-15T23:18:13.183632Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:2be3ab910ba418ce99f3be176eebb77bec3e05480e5fd5f5cff619ede9cdd8d3","observation_id":"ec5e0bda-8a02-41f0-904c-6d37dd09f835","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"PACE: An Optimal Piecewise Polynomial Approximation Unit for Flexible and Efficient Transformer Non- linearity Acceleration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-07-15T23:18:13.183632Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:ef20afd58620eb6070439591d0bf05e4511b892c01a744ff6fd61d871281c9c0","observation_id":"49393d3c-451d-4193-8683-07a989579fdb","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"Efficiency, Expressivity, and Extensibility in a Close- to-Metal NPU Programming Interface,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-07-15T23:18:13.183632Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:3bad0ee20a0bf002b395c9012d7e78646a4fbe64d286e7dba5f94c1c97bb6c7d","observation_id":"298e2b47-4141-406d-9e07-8406b95e6788","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-07-15T23:18:13.183632Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:c383f13ede38d8d9755e4b72c53898e091336cbe5915dfaab2c73d7b6a118911","observation_id":"c5179c24-4ad6-4893-8a0c-ee762a67cb6d","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06794","last_updated":"2025-09-08T15:22:51Z","snapshot_observed_at":"2026-08-04T23:12:23.325879Z","submitted_at":"2025-09-08T15:22:51Z","title":"Dato: A Task-Based Programming Model for Dataflow Accelerators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06794","snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"Dato: A Task-Based Programming Model for Dataflow Accelerators,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-07-15T23:18:13.183632Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"cited_paper":"/paper/2509.06794","citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:0f5460c21456ba516e4c9c5e3d1a8ab0e6ac991794b4db6d67cf5453800f9aaf","observation_id":"04dc20c6-24a3-41c4-a0f9-208596bc28e4","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"The Llama 3 Herd of Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-07-15T23:18:13.183632Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:aae7fcb72c98d39ad8af3e602ec62843913842a715041902c493e0a966c9bf21","observation_id":"e84660a6-0c51-43d8-9400-dd4e96c4dbab","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"Attention is All you Need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-07-15T23:18:13.183632Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:27da25557b93c39084a7335a8aca3b23653add4430beed6cbc36cd7c1230c811","observation_id":"81227a4a-1e43-4901-bdfe-527f98b79a34","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.02867","last_updated":"2018-07-28T06:51:27Z","snapshot_observed_at":"2026-07-06T06:37:55.065033Z","submitted_at":"2018-05-08T07:34:17Z","title":"Online normalizer calculation for softmax","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.02867","snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"Online normalizer calculation for softmax,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-07-15T23:18:13.183632Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"cited_paper":"/paper/1805.02867","citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:1f4f3121f88f18b420466c52cd37f040a48ee4d9f098298a035f15ca6c443815","observation_id":"e7938933-4197-4fa2-9022-0f06f642c0fb","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"Qualcomm Hexagon DSP: An architecture optimized for mobile multimedia and communications,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-07-15T23:18:13.183632Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:84e9db845933785472e8fdc4b4a37f0057214635717887b0bca25de5c533be3c","observation_id":"7cf0515c-fe3e-4696-b449-af178db110ce","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"ASCEND-CC: Confidential Computing on Heterogeneous NPU for Emerging Generative AI Workloads,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-07-15T23:18:13.183632Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:fb8904e126a05fcf0ab70c0ce891802dd54cb5066f7351f71592212491c8b7e4","observation_id":"bf284211-aa75-478b-ba22-d8d79a5c40a4","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"SPARTA: Spatial Acceleration for Efficient and Scalable Horizontal Diffusion Weather Stencil Computation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-07-15T23:18:13.183632Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:f2e91391729f35cd94ade5379ca062ee075e191a15675a26ad52ad98233318a5","observation_id":"89afd327-e73c-4ae8-a86b-eec2d7666a7d","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"You Only Look Once: Unified, Real-Time Object Detection,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-07-15T23:18:13.183632Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:082a6d420cd874e68e578c8ac80a50de12ed1f15ed7b5f32a3bfd04a4f952384","observation_id":"e9be7f1d-72f1-4fb9-8a13-f64e5799deea","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"14.5 Envision: A 0.26-to-10TOPS/W subword- parallel dynamic-voltage-accuracy-frequency-scalable Convolutional Neural Network processor in 28nm FDSOI,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-07-15T23:18:13.183632Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:7e930cccd766daa5ea81b0d4e701d9fed1e88f6d040752dc709069a53640dcc0","observation_id":"939f641c-a518-4d11-a121-0072a340699f","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"Basic Linear Algebra Subprograms for Fortran Usage,","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-07-15T23:18:13.183632Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:15dfc83d2685441e978fb2a3afb6e42cbc42bea0141de8a9ed80abdc9ed1d1f6","observation_id":"c3e47a6b-c8dd-4345-ac33-9ceea2c88789","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"AKG: automatic kernel generation for neural processing units using polyhedral transformations,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-07-15T23:18:13.183632Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:fc0cd323c3c21662dd79a7e48227c2e442406a1d031cc3d0556d2f9eee8ba33a","observation_id":"231500f8-a40c-4e67-a058-00385c9cff44","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-07-15T23:18:13.183632Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:5ee62f247cb0a762ea772c36685fe8d696ba4ea6ead2f5756a7880fb9bcbc91f","observation_id":"99b59607-afdf-41b0-a2ad-0073f3ef1f0b","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-07-15T23:18:13.183632Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2607.09385."}