{"as_of":"2026-08-09T03:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:27677f86086e7cbe0740dd46fad4be2ab9fa82939d5601e1d0efe3babd55898a","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:42:44.481313Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T16:10:40.858525Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T09:16:00.127986Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"cited_work":{"arxiv_id":"2505.14201","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14201","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alexandridis, V","venue":null,"work_id":"20e2adea-1347-4bd8-be57-f40cd0a7dc7b","year":2025},"citing_paper":{"arxiv_id":"2604.12798","last_updated":"2026-04-14T14:28:50Z","snapshot_observed_at":"2026-07-06T23:00:56.449281Z","submitted_at":"2026-04-14T14:28:50Z","title":"VFA: Relieving Vector Operations in Flash Attention with Global Maximum Pre-computation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T16:10:40.858525Z"},"links":{"cited_paper":"/paper/2505.14201","citing_paper":"/paper/2604.12798"},"observation_digest":"sha256:f6148ba6aebc4608844113d36af4d67576743b4d649d947df6135d5601b9848c","observation_id":"639b91f1-2560-466d-88fc-4a7dfc650174","resolution":{"observed_at":"2026-05-11T09:16:00.130999Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14201/citation-record","integrity":"/paper/2505.14201/integrity","json":"/paper/2505.14201/citation-record.json","paper":"/paper/2505.14201"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T15:42:41.396596Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:41.396596Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:82e8bc269f9db31356e12832c1c1acb1b52506ac6bb9df835d106ad822bba4e5","observation_id":"349993c8-feb5-4014-a864-1cfce29a038e","resolution":{"observed_at":"2026-08-07T15:42:41.396596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T15:42:41.486142Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:41.486142Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:aa257c9be4b9db730ab189e9bf81d14e9406b388026a280683710c931175a1aa","observation_id":"cee44612-0d29-43ac-8842-f30050447758","resolution":{"observed_at":"2026-08-07T15:42:41.486142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:48.775060Z","title":"Attention is all you need,","venue":null,"work_id":"f7348572-8d18-4ba3-849d-c95de0d853ab","year":2017},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:41.673709Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:20d332d966c13ebf6af371f459f25c60d97fa6556ac8f70ea331d042f4e9a494","observation_id":"7e8e00ff-03cd-4f0f-bb7f-91a51a4f3e07","resolution":{"observed_at":"2026-08-07T15:42:48.818408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-07T15:42:41.807184Z","title":"Longformer: The long- document transformer,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:41.807184Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:08caa1309a9f6bd59fc0eee5cb9380b4a39f08db86a90ea89eea89b806690f7d","observation_id":"7d28a434-0e31-4b99-8e28-4883668f8793","resolution":{"observed_at":"2026-08-07T15:42:41.807184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-06T08:05:35.311510Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-07T15:42:41.876917Z","title":"Generating long sequences with sparse transformers,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:41.876917Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:88f76493a523ddaf131889af6ae3ea63422299525b590dd570e484492b31890f","observation_id":"da553e48-38be-4b9b-9751-363622a02bb1","resolution":{"observed_at":"2026-08-07T15:42:41.876917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:48.614981Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention,","venue":null,"work_id":"20884f8e-8a6a-42f4-9307-7434fa7ac1b5","year":2020},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:41.944105Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:50c93bc020db976774e3fa75237150ccf02321575dce01e378280bf6eddd2b9e","observation_id":"d861182a-2346-4b5d-953d-333fccd78792","resolution":{"observed_at":"2026-08-07T15:42:48.665023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04009","last_updated":"2024-02-06T14:03:15Z","snapshot_observed_at":"2026-07-06T17:26:14.973632Z","submitted_at":"2024-02-06T14:03:15Z","title":"Low-rank Attention Side-Tuning for Parameter-Efficient Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2402.04009","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.04009","snapshot_observed_at":"2026-08-07T15:42:44.776272Z","title":"Low-rank Attention Side-Tuning for Parameter-Efficient Fine-Tuning","venue":"cs.CV","work_id":"1323316c-fba9-4445-9eb5-875096375c3a","year":2024},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:42.026401Z"},"links":{"cited_paper":"/paper/2402.04009","citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:0258d82ad430df15717929a7ad7766a3062dde954b6dd4deef0622de5dd24d68","observation_id":"fa7d2e7a-5ab0-4d68-95f9-2bc161848ece","resolution":{"observed_at":"2026-08-07T15:42:44.866897Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:48.325773Z","title":"A3: Accelerating attention mechanisms in neural networks with approximation,","venue":null,"work_id":"961f2b56-47c4-498e-891e-9cc98618bedd","year":2020},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:42.109222Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:b8af1174068bc48a8c2d84c6d23f85bd61cd52bcd170905fca96831020d7914e","observation_id":"e0b04749-b178-4e00-9827-2ec14640240c","resolution":{"observed_at":"2026-08-07T15:42:48.422976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:48.099103Z","title":"A 95.6-TOPS/W deep learning inference accelerator with per-vector scaled 4-bit quantization in 5 nm,","venue":null,"work_id":"675fdc43-133f-457b-bb31-504a8726f4b2","year":2023},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:42.213076Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:701dce7a9a85d93852445b177d5d0271e64e57e8cd3cf9fef52d8d5ab2dba585","observation_id":"9ddba633-3b3e-4e9a-adbc-cea455b0f1d7","resolution":{"observed_at":"2026-08-07T15:42:48.215809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:47.916217Z","title":"Hardware accelerator for multi-head attention and position-wise feed-forward in the trans- former,","venue":null,"work_id":"cb87c3c4-b06a-42e2-9e75-82361f137ece","year":2020},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:42.317685Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:4f53bb8073d9da3f911ed40857dbcf63e64ec612402c6f2bb3b1252d077cee04","observation_id":"c7ee989e-6d9e-4e31-be83-90ed16390a24","resolution":{"observed_at":"2026-08-07T15:42:47.975824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:42.406649Z","title":"Mnnfast: a fast and scalable system architecture for memory-augmented neural networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:42.406649Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:c8c45dc694ffdc262cad2fd0104c84611f8012708edef5d9c8f93c6092f7a04e","observation_id":"9f4355ff-8cb8-425e-a162-65cb5a70bd09","resolution":{"observed_at":"2026-08-07T15:42:42.406649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:47.684724Z","title":"COSA plus: Enhanced co-operative systolic arrays for attention mechanism in transformers,","venue":null,"work_id":"6885c1ac-1cd8-4209-90fd-8e80691fb147","year":2025},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:42.504330Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:abc718e07ead31a6ff69905dba6542e8251e6737ef384b1f8e4caa2be4723ff8","observation_id":"56ed8ec6-0c96-4456-91ee-eb4ee6ddd782","resolution":{"observed_at":"2026-08-07T15:42:47.793607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:47.359835Z","title":"ELSA: Hardware-software co-design for efficient, lightweight self- attention mechanism in neural networks,","venue":null,"work_id":"92a8897d-9dd1-4707-89f0-ddf89892b18f","year":2021},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:42.587501Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:766e39230ea18b7029e317297261d886767b8800ae060a94934947671bc46397","observation_id":"1fb37edb-fe37-4de3-abaa-efb49c65b383","resolution":{"observed_at":"2026-08-07T15:42:47.470310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:47.196878Z","title":"TSAcc: An efficient tempo-spatial similarity aware accelerator for attention acceleration,","venue":null,"work_id":"9bdbe0c3-d4c3-49a1-97fe-307879ed5df7","year":2024},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:42.681722Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:e1941459c2daea7aaaf44945a61d7bb8b4b0bd82d6fd8cbfc211d86c32f757ed","observation_id":"afb78e9b-4af3-4d79-a5f5-22c5fa03f436","resolution":{"observed_at":"2026-08-07T15:42:47.270387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:47.101146Z","title":"X-former: In-memory acceleration of transformers,","venue":null,"work_id":"ccc52804-33a8-4f6e-98c8-47cf45f7ede6","year":2023},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:42.769494Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:dc52ac854ccefdbb026fc9b55f4c16b03c6cf42ca7afecd2a9b19499c02cc390","observation_id":"4f386474-4bba-4ac7-b3fc-f64ac1eb530f","resolution":{"observed_at":"2026-08-07T15:42:47.146014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:42.843511Z","title":"Flashattention: Fast and memory-efficient exact attention with IO-awareness,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:42.843511Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:7d100ca4d5462d63a31383c6c7fd60b069231539591034bfb4c964e4538f7ecd","observation_id":"9fb1e344-3540-4a0e-8e48-92d009a77b53","resolution":{"observed_at":"2026-08-07T15:42:42.843511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-07T15:42:42.955605Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:42.955605Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:32f99ce24dbcc52f21f36d063a0eb15c46d724a30514e865b3a6d68f5eefd308","observation_id":"f153e9dd-7686-4826-9cd3-73827174f756","resolution":{"observed_at":"2026-08-07T15:42:42.955605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-07T15:42:43.089177Z","title":"Self-attention does not need O(n2) memory,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:43.089177Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:2491f603f4a096d5205b57717666ea88a5c2580edd94bf7729b492023e0f5294","observation_id":"d1bdae36-d87c-4e8e-bc7c-ff74eab4a9a4","resolution":{"observed_at":"2026-08-07T15:42:43.089177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:46.918968Z","title":"Hardware-efficient softmax approximation for self-attention networks,","venue":null,"work_id":"efeddfd1-af7e-4967-a4ff-9e0e0fc24752","year":2023},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:43.180030Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:89bddcafb871b73d54741c6a6d0601fe67b020ed937e7fe96fd6d5de8430160a","observation_id":"a7f5bb64-107c-4696-89dc-2b8e594bb8b9","resolution":{"observed_at":"2026-08-07T15:42:47.014152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:46.731861Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":"f2489270-ccf2-4f01-93eb-9d48a6694067","year":2019},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:43.289112Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:e2d9cd3e2aec3706f1b45f9e4e17ec6cf6162095d8ba60ecd5c19779854fa8e5","observation_id":"6ede0174-f242-48c7-9086-66d271395e83","resolution":{"observed_at":"2026-08-07T15:42:46.816425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:46.547243Z","title":"Fastervit: Fast vision transformers with hierarchical attention,","venue":null,"work_id":"dbde1d53-23cc-42e3-bf4c-1315cf97bf4d","year":2024},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:43.386091Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:d97f814592972fb8d6bbaee95d9b1e3891e511ca2a34f7ed0d6483618f927ba0","observation_id":"f091fd2e-ee33-4128-9ef7-e09aa398d584","resolution":{"observed_at":"2026-08-07T15:42:46.664766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10930","last_updated":"2024-11-15T00:09:44Z","snapshot_observed_at":"2026-07-06T17:31:21.158599Z","submitted_at":"2024-01-31T17:52:52Z","title":"ConSmax: Hardware-Friendly Alternative Softmax with Learnable Parameters","version":3},"cited_work":{"arxiv_id":"2402.10930","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.10930","snapshot_observed_at":"2026-08-07T15:42:44.619381Z","title":"ConSmax: Hardware-Friendly Alternative Softmax with Learnable Parameters","venue":"cs.AR","work_id":"1b0d6da0-d525-4caf-9bb4-e15c655948c3","year":2024},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:43.511403Z"},"links":{"cited_paper":"/paper/2402.10930","citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:5f37bc7ad82e100deff29163e0726178677bb9d6a08e5f1c4be7b9369fc41f5e","observation_id":"07f7228f-5b5f-473f-8d4e-b13b1718f94b","resolution":{"observed_at":"2026-08-07T15:42:44.687202Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.02867","last_updated":"2018-07-28T06:51:27Z","snapshot_observed_at":"2026-07-06T06:37:55.065033Z","submitted_at":"2018-05-08T07:34:17Z","title":"Online normalizer calculation for softmax","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.02867","snapshot_observed_at":"2026-08-07T15:42:43.564642Z","title":"Online normalizer calculation for softmax,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:43.564642Z"},"links":{"cited_paper":"/paper/1805.02867","citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:294991de892b0c1cf8fa9a4b3a28c11badc7a366a6ce5b95d4695da4c21ce809","observation_id":"e64bf920-7b6b-4733-a4e8-43710b9e17ee","resolution":{"observed_at":"2026-08-07T15:42:43.564642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:46.388599Z","title":"Edge- BERT: sentence-level energy optimizations for latency-aware multi-task NLP inference,","venue":null,"work_id":"a5f32ffe-28af-4ad5-b625-89431066acc9","year":2021},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:43.672792Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:75315208983e91ac3052b49ebb06a001200cbc595cfac694d9ad28431a05b44e","observation_id":"c8dd91a7-88e8-490a-9ad8-596a052082d9","resolution":{"observed_at":"2026-08-07T15:42:46.461527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:46.224352Z","title":"Online alignment and ad- dition in multiterm floating-point adders,","venue":null,"work_id":"d76852ae-0160-4867-86d5-fe839996fc94","year":2025},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:43.742667Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:a6c0b05aa503c61af373d047690474fd8e5806cd8822b642c4951bbc65932beb","observation_id":"c3816f74-255d-41a5-b4b9-ae90019b3b14","resolution":{"observed_at":"2026-08-07T15:42:46.289950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:45.997640Z","title":"Templatized fused vector floating-point dot product for high-level synthesis,","venue":null,"work_id":"28252965-ae82-4666-a8cd-6ff25faf93bf","year":2022},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:43.837986Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:50998b612538cbac7696153274b4f39d88cb6404c4b9342a1934fe73a21269d8","observation_id":"6be2cb52-9b72-4d12-a75e-6b2b464b6237","resolution":{"observed_at":"2026-08-07T15:42:46.107398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:45.760616Z","title":"SOLE: hardware- software co-design of softmax and layernorm for efficient transformer inference,","venue":null,"work_id":"aca5b48c-66b1-4412-9d0f-acdcfec4054e","year":2023},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:43.892396Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:e2e57af238e75947060baae4433683b9d365a44f3fa3901b477349fca6b9afda","observation_id":"846fc410-41d1-4944-af98-ba7a8780ab8c","resolution":{"observed_at":"2026-08-07T15:42:45.921795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:45.544649Z","title":"A pseudo-softmax function for hardware-based high speed image classification,","venue":null,"work_id":"4bd0f6ec-b050-4af8-8c93-7b121ccede53","year":2021},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:43.975312Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:159bb46c38afd30a85c1f322b9f630127307986f77ea8322358ab5867ddace29","observation_id":"a277cdac-02a1-4c13-bfc7-0670df9ea99c","resolution":{"observed_at":"2026-08-07T15:42:45.672152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:45.337580Z","title":null,"venue":null,"work_id":"82520531-42b2-4224-8f10-785931d4a0ff","year":2019},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:44.081992Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:fae3a0e8f668ea37350c4a2ee7be83e3ba5575a6e5799f6d7c350b352b62f92e","observation_id":"9864db61-9e6f-453b-ad20-dd321fa8a926","resolution":{"observed_at":"2026-08-07T15:42:45.444137Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.12322","last_updated":"2019-06-13T17:55:30Z","snapshot_observed_at":"2026-08-04T04:17:53.148033Z","submitted_at":"2019-05-29T10:50:32Z","title":"A Study of BFLOAT16 for Deep Learning Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.12322","snapshot_observed_at":"2026-08-07T15:42:44.143506Z","title":"A study of bfloat16 for deep learning training,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:44.143506Z"},"links":{"cited_paper":"/paper/1905.12322","citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:0a700a002929237ef1d1956d829d560581b80c626932ebdfa9622df65997574d","observation_id":"ae3bb868-7e88-46ce-9cc4-dce72a816076","resolution":{"observed_at":"2026-08-07T15:42:44.143506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.05433","last_updated":"2022-09-29T20:47:07Z","snapshot_observed_at":"2026-07-06T13:51:20.183063Z","submitted_at":"2022-09-12T17:39:55Z","title":"FP8 Formats for Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.05433","snapshot_observed_at":"2026-08-07T15:42:44.231773Z","title":"Fp8 formats for deep learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:44.231773Z"},"links":{"cited_paper":"/paper/2209.05433","citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:8eb3686cdc859fd008a78f4ba8596888961c4b76212149b5ca45351ee286fb1a","observation_id":"9b71812c-8888-4890-9a49-da600fbe2d7c","resolution":{"observed_at":"2026-08-07T15:42:44.231773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:45.168806Z","title":"llama2.c,","venue":null,"work_id":"46f55dc8-6b61-4b04-a442-aad5ad6f77a7","year":2023},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:44.321271Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:5e94d4ec910b1182a3b4a7e769b53d3ef3d8f125b29e52c8c6aad4bf46d10559","observation_id":"69bfcb20-f662-49e6-ba4c-34dd47ec368b","resolution":{"observed_at":"2026-08-07T15:42:45.225376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:44.991734Z","title":"Transformers: State-of-the-art natural language processing,","venue":null,"work_id":"760da553-abf9-4333-9b23-e557cfbf7dcb","year":2020},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:44.407672Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:a1450788031af8222809ea3d036ba62204a19c65014ef040de6b4365015a1aee","observation_id":"ac1a776d-c7f3-4bb4-ab42-eb83152947a4","resolution":{"observed_at":"2026-08-07T15:42:45.046848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07910","last_updated":"2024-08-20T00:28:45Z","snapshot_observed_at":"2026-08-05T04:16:54.399572Z","submitted_at":"2023-12-13T05:58:34Z","title":"PromptBench: A Unified Library for Evaluation of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07910","snapshot_observed_at":"2026-08-07T15:42:44.481313Z","title":"Promptbench: A unified library for evaluation of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:44.481313Z"},"links":{"cited_paper":"/paper/2312.07910","citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:56bbfc4ad4c638926c0648a19f8557cbf66dbe78d620cb285f867afa0b02c7a9","observation_id":"e3b17ae8-85ee-4fe3-a048-05050b577aba","resolution":{"observed_at":"2026-08-07T15:42:44.481313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":2,"verified_fuzzy":19},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 1 inbound Pith citation observation for arXiv:2505.14201."}