{"as_of":"2026-08-09T07:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8ff388c400acdd2a3d2c1112ef7c0748a0881dfb3f52cf236589838e215ef664","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:11:14.757058Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T04:14:11.793614Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T01:06:24.646981Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"cited_work":{"arxiv_id":"2507.16676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.16676","snapshot_observed_at":"2026-07-02T01:06:24.646981Z","title":"Custom algorithm-based fault tolerance for attention layers in transformers.arXiv:2507.16676, 2025","venue":null,"work_id":"5024afe9-9b4c-4e53-a8d4-c6b4587b2586","year":2025},"citing_paper":{"arxiv_id":"2606.02430","last_updated":"2026-06-01T16:04:51Z","snapshot_observed_at":"2026-08-07T20:16:33.113391Z","submitted_at":"2026-06-01T16:04:51Z","title":"Not All Errors Are Equal: A Systematic Study of Error Propagation in Large Language Model Inference","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-28T12:36:23.320194Z"},"links":{"cited_paper":"/paper/2507.16676","citing_paper":"/paper/2606.02430"},"observation_digest":"sha256:28264b8b74e45cc67281c1e4286bd2bdee6d714e232d3f4ed63fe040214ee9ca","observation_id":"5ada3721-6945-4e6a-a34f-318d1719c932","resolution":{"observed_at":"2026-07-02T01:06:24.648870Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"cited_work":{"arxiv_id":"2507.16676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.16676","snapshot_observed_at":"2026-07-02T01:06:24.646981Z","title":"Custom algorithm-based fault tolerance for attention layers in transformers.arXiv:2507.16676, 2025","venue":null,"work_id":"5024afe9-9b4c-4e53-a8d4-c6b4587b2586","year":2025},"citing_paper":{"arxiv_id":"2606.27934","last_updated":"2026-06-26T10:26:50Z","snapshot_observed_at":"2026-07-07T00:02:04.432452Z","submitted_at":"2026-06-26T10:26:50Z","title":"Self-Verifying Measurement Records: Hash-Linked Evidence Graphs for Hardware Benchmarking","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-29T04:14:11.793614Z"},"links":{"cited_paper":"/paper/2507.16676","citing_paper":"/paper/2606.27934"},"observation_digest":"sha256:926b96f799ea956358943edef8120825b2da4c264813210ebe40b9659de0f92d","observation_id":"6658f018-4ac8-44a5-ac88-3c0f9c2152f5","resolution":{"observed_at":"2026-07-01T17:05:50.955968Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.16676/citation-record","integrity":"/paper/2507.16676/integrity","json":"/paper/2507.16676/citation-record.json","paper":"/paper/2507.16676"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.252536Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":"e3749386-7414-4c69-8731-df83ace55305","year":2020},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:12.856969Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:8e4755e8c20b5fa5d39373c5a0bff55f3e79785cf64027f1a4b6323d10906a88","observation_id":"1726cef6-75a7-4ce1-837c-824687e063c7","resolution":{"observed_at":"2026-08-06T15:11:15.258961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T15:11:12.939944Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:12.939944Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:86e4ad352ee075cadee924d69fc068f68e64b1dfd75ff3bd27c7262f103cde20","observation_id":"4da5dd94-c367-4018-ba04-582409e69339","resolution":{"observed_at":"2026-08-06T15:11:12.939944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.236914Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":"51636202-62e2-41aa-a97d-e20afa87df07","year":2021},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:12.994346Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:43e0cfdecba78d30db961992436a24180b8f0f222c7734c40fa428829a901cc0","observation_id":"a1afa995-413d-4e94-b78c-a71235cd3281","resolution":{"observed_at":"2026-08-06T15:11:15.241717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:13.029505Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:13.029505Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:c49c4620e7ae9b6884b98cd38e82a344ce9b12ba35a1763008a0f829ebf4dcf6","observation_id":"20d921e8-6919-4c0d-9d9e-0a0a27c4412e","resolution":{"observed_at":"2026-08-06T15:11:13.029505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.208958Z","title":"BERT: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":"75ed23c6-3c2c-4429-8eb4-c994ff5dfd46","year":2019},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:13.142377Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:ff2aada8dad5dd5372552ecb4b70a0b276020a9f3090ada832cad978e513f37d","observation_id":"a09977e7-0f39-4512-bbe8-e4077bc9fbe9","resolution":{"observed_at":"2026-08-06T15:11:15.213824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.184180Z","title":"ALBERT: A lite bert for self-supervised learning of language represen- tations,","venue":null,"work_id":"6fbf7682-5ed2-4577-9762-8f05402ecca1","year":2020},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:13.230159Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:eb61752f9d0a24c6babf48b32799d34a6e662d19134378120a8e9a6887fe4beb","observation_id":"2a891ef4-de55-4400-92cc-4e2116c50824","resolution":{"observed_at":"2026-08-06T15:11:15.195794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-06T15:11:13.311438Z","title":"Longformer: The long- document transformer,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:13.311438Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:492843bbf3f671049d1c9a9abddc894158100a2450cbd0e421ab72bc55fe1986","observation_id":"1537dfb6-9156-4d47-bb92-c1090cd701a8","resolution":{"observed_at":"2026-08-06T15:11:13.311438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-09T05:01:32.757930Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-06T15:11:13.465021Z","title":"Generating long sequences with sparse transformers,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:13.465021Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:3545a1acabbbb857e1ff7362531b7cc41e8160d18c6eb2f25a48f9d8cab3287f","observation_id":"67ea9787-9010-4110-b306-2a138b8e6fe1","resolution":{"observed_at":"2026-08-06T15:11:13.465021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.169604Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention,","venue":null,"work_id":"9ff918a9-c346-4e60-b955-ffc3b7753bf2","year":2020},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:13.606383Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:9344ac7cc0dd352055a4a3c74fbca72fe6647fa8441f0c8c07b7afc51c9ced20","observation_id":"c3642d0b-c345-4a11-bca0-c8daf9967d3b","resolution":{"observed_at":"2026-08-06T15:11:15.174047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-08-06T15:11:13.710772Z","title":"Linformer: Self-attention with linear complexity,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:13.710772Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:a8630d9779e7a2e5a2d6acda07635b034ba81708ebd992f4fd5bdbfd0456ad65","observation_id":"2b1bdcbb-ad84-4906-8dea-3dd5314f9036","resolution":{"observed_at":"2026-08-06T15:11:13.710772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.155182Z","title":"Flashattention: Fast and memory-efficient exact attention with IO-awareness,","venue":null,"work_id":"dd23ec3a-6dc0-403f-9044-04828931cee5","year":2022},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:13.849399Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:ff6ba4e163b5e575e313815e47be61f07e387c603506b51d0e2d2dc579591b10","observation_id":"e2a02d83-144b-4fc3-805c-e5fa7ff7d6b0","resolution":{"observed_at":"2026-08-06T15:11:15.159661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-06T15:11:13.979517Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:13.979517Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:34a7b41b800a8e77097c08bd3c636c787fb0972605b8c3ec84e09a9a01a50887","observation_id":"224d45e6-ed93-4230-ba39-554804dfef5c","resolution":{"observed_at":"2026-08-06T15:11:13.979517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-06T15:11:14.081783Z","title":"Self-attention does not need O(n2) memory,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.081783Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:2ce4b51c0a83d714db3b106a1182a2e42270c81e4d93824b3064c0259a370db0","observation_id":"638ae11d-b20d-40e9-b01c-805952011d9b","resolution":{"observed_at":"2026-08-06T15:11:14.081783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.142318Z","title":"Testability and dependability of ai hardware: Survey, trends, challenges, and perspectives,","venue":null,"work_id":"d5e063a4-7754-4536-afcf-94d1eb045f28","year":2023},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.223539Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:0c072f01f732b4d934058ce59ddee6fca318af4160a93f970473d1d2b66a54f7","observation_id":"f871cac0-fd3d-409c-915f-bb332ca2a661","resolution":{"observed_at":"2026-08-06T15:11:15.146191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.128958Z","title":"Radiation-induced soft errors in advanced semiconductor technologies,","venue":null,"work_id":"aa91c087-8004-4b3f-b6bc-be403559131a","year":2005},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.334947Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:199efdfb2b6b5ef5ec624d506a39869c4fb2c53ba10e05ca048761603455cb59","observation_id":"71bc6a85-2426-4b23-83df-16ba079075cb","resolution":{"observed_at":"2026-08-06T15:11:15.133086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.113365Z","title":"Designing reliable systems from unreliable components: the challenges of transistor variability and degradation,","venue":null,"work_id":"cbb46d10-81f3-4caf-9021-b4c6973438dc","year":2005},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.499102Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:d7faece379f51ce4634741805cb5e5335f256169939ce83c8cb5a67f694307a4","observation_id":"7ca68cc3-8aee-44dc-b5f6-ffa33f6aa9dc","resolution":{"observed_at":"2026-08-06T15:11:15.118044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.099524Z","title":"Koren and C","venue":null,"work_id":"59e24fd0-967b-48a9-aeba-0832f344d619","year":2020},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.643518Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:397080538d337ebc046e2ea4f16fcc08e01528fff2cbf11666f28bfdfc8d31bd","observation_id":"ee666352-902a-450a-bdd1-06b1f0d9933f","resolution":{"observed_at":"2026-08-06T15:11:15.103951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.085144Z","title":"Algorithm-based fault tolerance for matrix operations,","venue":null,"work_id":"b129a76a-65fd-4dbc-b0f1-05ce469c48cd","year":1984},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.700405Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:a2922fd958418dd47a2b411a0760e27c6811cb875b95b4e0d33db8cf366ad89c","observation_id":"0cbad548-a087-4880-8e34-edd838c1435d","resolution":{"observed_at":"2026-08-06T15:11:15.089713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.069412Z","title":"Towards practical algorithm based fault tolerance in dense linear algebra,","venue":null,"work_id":"478d398c-23bc-4ac8-8d56-0cd2d86071ea","year":2016},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.704838Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:826aa124b7424a61d1177c9fdfee1fbc926798c183d5bdf305a8232888e8ce10","observation_id":"7bb21ce6-8621-46fb-a2d0-12c872287a08","resolution":{"observed_at":"2026-08-06T15:11:15.074743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.055623Z","title":"Low-cost online convolution checksum checker,","venue":null,"work_id":"87b7810b-0072-4449-af1d-0bab7f56c913","year":2022},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.708914Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:f55180e75d47824560bf4c5bfe4721f654314c26ce6063eb650cfaddfc471539","observation_id":"e996bb4f-9dc7-4655-bc83-9b40101f8eac","resolution":{"observed_at":"2026-08-06T15:11:15.059694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.041952Z","title":"Making convolutions resilient via algorithm-based error detection techniques,","venue":null,"work_id":"76969715-4295-4a70-b936-ac4a2ddd22eb","year":2021},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.713172Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:6917f7ce3f43df65aba3d9f83bae321dac3f8f69121211dd010c82ffaec8c19d","observation_id":"36c45af1-b32d-4f3d-a4bb-903cd44c9458","resolution":{"observed_at":"2026-08-06T15:11:15.046116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.028140Z","title":"GCN-ABFT: Low-cost online error checking for graph convolutional networks,","venue":null,"work_id":"a8bc35ff-ab05-49ff-a949-312f8383a62e","year":2025},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.717974Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:0d4b29b32914f280950ce1dae1d9f16e4a25abd1d5d21b4bbf64a94aae7f95ec","observation_id":"191a8307-dc79-4808-9aa7-2b79db652095","resolution":{"observed_at":"2026-08-06T15:11:15.032332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.10469","last_updated":"2025-04-21T02:17:47Z","snapshot_observed_at":"2026-08-04T19:44:28.380482Z","submitted_at":"2023-02-21T06:21:28Z","title":"ApproxABFT: Approximate Algorithm-Based Fault Tolerance for Neural Network Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.10469","snapshot_observed_at":"2026-08-06T15:11:14.722039Z","title":"Approxabft: Approximate algorithm-based fault tolerance for neural network pro- cessing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.722039Z"},"links":{"cited_paper":"/paper/2302.10469","citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:d9436cf1cf0d0c3af681bad35a8ba89ebfdcb63c218ee40a4be3c012dc0646e5","observation_id":"cd30ca60-d1c9-4606-802d-66762c458f80","resolution":{"observed_at":"2026-08-06T15:11:14.722039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.012391Z","title":"ATTNChecker: Highly-optimized fault tolerant attention for large language model train- ing,","venue":null,"work_id":"2e509cc9-6125-4026-a3d1-e94772d294fb","year":2025},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.726171Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:d9b987adad5d4a8b4763a700a50aa12f22286de7dd260a5e3d6f87b69eac0a24","observation_id":"8023e98d-5b9e-4789-aca6-5a691cffcec9","resolution":{"observed_at":"2026-08-06T15:11:15.017561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:14.993738Z","title":"Error resilient transformers: A novel soft error vulnerability guided approach to error checking and suppression,","venue":null,"work_id":"97b40999-760c-40a5-893d-210e1b2dc86e","year":2023},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.730302Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:c5d6dda803f78c87b3fa6e9d2ef0da7e06d584df7efb59098f1e1d4cc2e51945","observation_id":"5d8a004a-ae2c-4111-9990-a4fac118f290","resolution":{"observed_at":"2026-08-06T15:11:14.998636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:14.979361Z","title":"Language models are unsupervised multitask learn- ers,","venue":null,"work_id":"98463836-5fee-448c-b049-96d62340c2c3","year":2019},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.734026Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:5dd63e0d2db280360fa83d4f7c09aa558292ef73fa32fe8a08b88035a823cc0e","observation_id":"aa88b97b-615f-45d0-9b79-48bd054a1690","resolution":{"observed_at":"2026-08-06T15:11:14.983410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:14.965792Z","title":"Attention is all you need,","venue":null,"work_id":"c5b5881d-3f7d-4630-a348-dad3c26185d5","year":2017},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.738353Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:3a5c24ba1d4fe00dd8fc330ff9a486c99d32df8f2bd548ff564f1aadffca2665","observation_id":"11c98e64-7fa8-4204-b16c-3efb622cb0ab","resolution":{"observed_at":"2026-08-06T15:11:14.969704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:14.951048Z","title":"Mnnfast: a fast and scalable system architecture for memory-augmented neural networks,","venue":null,"work_id":"169b789d-f898-4c15-9103-d7cf62901666","year":2019},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.742149Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:a98c6e7af5ad534424a88afd6905b970ae53b79a045ef6d86ee9fe0ffc07a948","observation_id":"d201a12b-bd95-42cb-ba83-5c45b9d0acbc","resolution":{"observed_at":"2026-08-06T15:11:14.955836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.02867","last_updated":"2018-07-28T06:51:27Z","snapshot_observed_at":"2026-07-06T06:37:55.065033Z","submitted_at":"2018-05-08T07:34:17Z","title":"Online normalizer calculation for softmax","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.02867","snapshot_observed_at":"2026-08-06T15:11:14.746427Z","title":"Online normalizer calculation for softmax,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.746427Z"},"links":{"cited_paper":"/paper/1805.02867","citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:846e524c0dd76fc3d442cddc5b0e187400c60614f26ebd066ae5e4e3dfc1245d","observation_id":"7d34483d-868d-4fac-a524-80541c150029","resolution":{"observed_at":"2026-08-06T15:11:14.746427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-06T15:11:14.752400Z","title":"Huggingface’s trans- formers: State-of-the-art natural language processing,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.752400Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:0600af8597816b07c3a3bf25ba0df20bdcbf9366693eda480f4d286af0a0ce03","observation_id":"b25e2d2f-7a4a-4b63-a6d5-3c82c9e06d6b","resolution":{"observed_at":"2026-08-06T15:11:14.752400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:14.933940Z","title":"Automatic detection of floating- point exceptions,","venue":null,"work_id":"9aa33874-d727-4436-8762-e177f9978d1a","year":2013},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.757058Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:5cd0799b75f7cb01af8ae7494fea43d76b5e3b645a50dba4c43291c9964b6696","observation_id":"8973ae6c-3569-4362-b91e-d8841794b4e3","resolution":{"observed_at":"2026-08-06T15:11:14.940425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":21},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 2 inbound Pith citation observations for arXiv:2507.16676."}