{"as_of":"2026-08-21T18:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:023d73a4f2aa3343ee796f44d7ed47dae9da4bcc02e4d0afa9ea6f8ba1afaf38","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T14:38:49.937475Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.01770/citation-record","integrity":"/paper/2502.01770/integrity","json":"/paper/2502.01770/citation-record.json","paper":"/paper/2502.01770"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:38:50.691025Z","title":"The groq software-defined scale-out tensor streaming multipro- cessor: From chips-to-systems architectural overview","venue":null,"work_id":"c92d46ae-0bc4-47e3-9584-e3ec8e3fece1","year":2022},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.492977Z"},"links":{"citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:fa956a3f9959c112680ca39016c5b16ebdf28d1e8099c771b1191874a9b5fceb","observation_id":"b419006d-16a3-4c9b-afff-7893d0332736","resolution":{"observed_at":"2026-08-09T14:38:50.763089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:38:50.528402Z","title":"Vivit: A video vision transformer","venue":null,"work_id":"57ec6878-e0a1-4ac4-b9f9-3f2c83d6aa45","year":2021},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.539242Z"},"links":{"citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:c446036e0e6fb9c86ce12910475f1c8259d9ab914c5ef1cd80ccb81eb02f4c1f","observation_id":"ae8bf404-f7de-435d-8646-bb8240fda371","resolution":{"observed_at":"2026-08-09T14:38:50.599079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-09T14:38:49.560159Z","title":"Long- former: The long-document transformer","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.560159Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:0cdde042be0ca9b8bd6b9ba79388ed22d0e68bc4833a1354fb66e0f33c4d05ae","observation_id":"acea6c6d-1f90-4dcb-a543-e1ea593118f8","resolution":{"observed_at":"2026-08-09T14:38:49.560159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:38:50.502438Z","title":"Prime: A novel processing-in-memory architecture for neural net- work computation in reram-based main memory","venue":null,"work_id":"f131a1a5-365e-4eba-94a5-8a744ffcc905","year":2016},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.583032Z"},"links":{"citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:365f0ee7ba6a21a61a753fa60d9c7f0f3b39ce2f78436666aed2720cf468caa1","observation_id":"3d1f5d20-4f82-4cc4-be9d-ccf2dc5da61b","resolution":{"observed_at":"2026-08-09T14:38:50.505984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:38:50.492457Z","title":"On a model of associative memory with huge storage capacity","venue":null,"work_id":"203bc0fe-ea28-49fc-97c0-68fbf4cb5575","year":2017},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.601191Z"},"links":{"citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:8203e7ffe346c89ccf4730f1da1f5755667d7c52d20f3e85891382829793ccf7","observation_id":"e3025021-94c1-4ca1-a82f-0ae969d232f6","resolution":{"observed_at":"2026-08-09T14:38:50.495954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:38:50.482510Z","title":"Imagenet: A large-scale hierarchical im- age database","venue":null,"work_id":"d25c6c2a-3c86-467d-bdd8-76a3cfdca771","year":2009},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.623282Z"},"links":{"citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:c72e8588aa21013621a98947d9f0675de126426de58a92d46cfe44009838a322","observation_id":"fbbc6e7a-07a2-462a-b65e-7f01f8e25bc6","resolution":{"observed_at":"2026-08-09T14:38:50.485968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-09T14:38:49.634024Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding.arXiv preprint arXiv:1810.04805, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.634024Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:dead1b8663e24edddcc8ddc3303d490be485732a460cd91490afc4b48170a18b","observation_id":"f8830fe7-2255-458e-b758-5955e30abd1d","resolution":{"observed_at":"2026-08-09T14:38:49.634024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-09T14:38:49.643210Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.643210Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:6bc9455953f4cb0ecfff58edac456b1814561c6e15a11c70c7b1490a4e5351bb","observation_id":"16af9084-2018-4824-9596-3b991fcba02b","resolution":{"observed_at":"2026-08-09T14:38:49.643210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:38:50.472264Z","title":"Array multiplier using xnor","venue":null,"work_id":"2d9e287e-5e9a-40f2-ac6c-5e0d27b17510","year":2013},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.646724Z"},"links":{"citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:5f6e6e215f67932a03fc4f0d56abcb8bcf327578a4aa890a848269ecc4360243","observation_id":"81bce930-33a2-4d9f-8423-e1af50bfcb83","resolution":{"observed_at":"2026-08-09T14:38:50.475473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-08-17T20:47:46.242385Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-09T14:38:49.650499Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.650499Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:ae837330202bf957809d9b694974da8c2d5a243eb17769b3ad3ea31af399cb2e","observation_id":"4968c933-7ede-4ef1-aa50-12bb47aee446","resolution":{"observed_at":"2026-08-09T14:38:49.650499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:38:50.461653Z","title":"Sparse co-attention visual question answering networks based on thresholds","venue":null,"work_id":"be638334-dc4f-48fd-8fe6-92d7da609a64","year":2023},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.654038Z"},"links":{"citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:fe0290c269447ba11cb66c34c7b045a4bde33b9c014dd79160dc9b110a6d4f2c","observation_id":"8717f85c-2bab-4f52-bd26-00d9b1b0779a","resolution":{"observed_at":"2026-08-09T14:38:50.465098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:38:50.451214Z","title":"Bivit: Ex- tremely compressed binary vision transformers","venue":null,"work_id":"870dd262-c3b7-4e49-883c-72ecedecf361","year":2023},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.657745Z"},"links":{"citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:1a530ec67a2bb9b22f95c8c9e22a93595c5708024b8566cceb0f2272340b633f","observation_id":"c03eb002-a4b6-480d-a948-1d151862ad9c","resolution":{"observed_at":"2026-08-09T14:38:50.455127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:38:50.440225Z","title":"Binarized neural net- works","venue":null,"work_id":"cbb8df82-c93b-4f76-bef7-a22fb2eacf38","year":2016},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.661797Z"},"links":{"citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:ae27bec6e932a6d370e68997864d5e2f1699d459f73df94cd97c31ea0e2f11bf","observation_id":"d2588fec-12a9-41f7-b23b-b3ccd450ae75","resolution":{"observed_at":"2026-08-09T14:38:50.444198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:38:50.429285Z","title":"In-datacenter performance analysis of a tensor process- ing unit","venue":null,"work_id":"b2647894-cecf-46cc-bc08-e352377f3c3e","year":2017},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.665369Z"},"links":{"citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:df5919e1161e629c40a287d439ee6b6fc3a87107e106429f9014e9549383263c","observation_id":"c2da33d0-4378-41ee-9ef0-1a27d49c5da5","resolution":{"observed_at":"2026-08-09T14:38:50.432867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-09T14:38:49.668762Z","title":"Scal- ing laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.668762Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:fe22abacd8abafa9159b267feeba26ecec9e91fc146aff485855206ccc00dd13","observation_id":"739ad5b8-32c2-4791-8ae2-1575d658db63","resolution":{"observed_at":"2026-08-09T14:38:49.668762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04451","last_updated":"2020-02-18T16:01:18Z","snapshot_observed_at":"2026-07-06T08:50:12.690900Z","submitted_at":"2020-01-13T18:38:28Z","title":"Reformer: The Efficient Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.04451","snapshot_observed_at":"2026-08-09T14:38:49.672683Z","title":"Reformer: The efficient transformer","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.672683Z"},"links":{"cited_paper":"/paper/2001.04451","citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:45678882121378f281596b720dbe58ba722117e5b6b9225d399b8e3bc3201deb","observation_id":"31f9d1e8-1f92-4f49-9c24-6adbec35840b","resolution":{"observed_at":"2026-08-09T14:38:49.672683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.00730","last_updated":"2019-02-02T14:48:16Z","snapshot_observed_at":"2026-08-14T17:21:56.479666Z","submitted_at":"2019-02-02T14:48:16Z","title":"Self-Binarizing Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.00730","snapshot_observed_at":"2026-08-09T14:38:49.676164Z","title":"Self-binarizing networks","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.676164Z"},"links":{"cited_paper":"/paper/1902.00730","citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:1498158cd8b582472672ab4508e230e7a694ddb3aa779350d66f0de85e88f567","observation_id":"01440fe2-66d2-4c8d-8b0b-8dd749c24c58","resolution":{"observed_at":"2026-08-09T14:38:49.676164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04683","last_updated":"2017-12-05T19:36:03Z","snapshot_observed_at":"2026-08-18T01:17:42.874463Z","submitted_at":"2017-04-15T19:31:41Z","title":"RACE: Large-scale ReAding Comprehension Dataset From Examinations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.04683","snapshot_observed_at":"2026-08-09T14:38:49.680009Z","title":"Race: Large-scale reading com- prehension dataset from examinations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.680009Z"},"links":{"cited_paper":"/paper/1704.04683","citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:341fe655bb6382ee44ef790e85d28cdea3636275730cbd203ac514e97fad72cd","observation_id":"d31963a7-fa17-4619-9d2e-b0ac05b836d2","resolution":{"observed_at":"2026-08-09T14:38:49.680009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:38:50.418734Z","title":"Power and area-efficient xnor-and hybrid binary neural networks using tft-type synaptic devices","venue":null,"work_id":"5d2a0468-8f67-4e98-886d-6e5c112d23c1","year":1912},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.683729Z"},"links":{"citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:7cf1f3502098cbdaf6d9a7a5ee0592b340e79d4f5879942705a81b6e5d7283ed","observation_id":"c3216a18-f736-4ffc-9971-a5a626e5eeb5","resolution":{"observed_at":"2026-08-09T14:38:50.422609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:38:50.406770Z","title":"Fp-bnn: Binarized neural network on fpga","venue":null,"work_id":"aa221bed-4cb3-4323-8e41-0d4cad27b425","year":2018},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.686956Z"},"links":{"citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:ecc0610aaeebe4f8f586d580493b378e8042dd8087977d2c9da1164238b052eb","observation_id":"a344935e-b50f-4b82-815b-c1b2ec237ce4","resolution":{"observed_at":"2026-08-09T14:38:50.411234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:38:50.382196Z","title":"Cerebras architecture deep dive: First look inside the hw/sw co-design for deep learning: Cerebras systems","venue":null,"work_id":"93abdc31-dd08-46d8-b247-4d9b4ca5d7c0","year":2022},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.690355Z"},"links":{"citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:76e40043571552ffc44b8fde8f2fddacbbd8d3aaa766c9b01f7c2bbaaa77e584","observation_id":"f0c4a837-bee6-40f8-926e-ec8c506c48f9","resolution":{"observed_at":"2026-08-09T14:38:50.398540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.11299","last_updated":"2021-10-21T17:31:57Z","snapshot_observed_at":"2026-08-20T04:23:29.388265Z","submitted_at":"2021-10-21T17:31:57Z","title":"Transformer Acceleration with Dynamic Sparse Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.11299","snapshot_observed_at":"2026-08-09T14:38:49.693578Z","title":"Transformer acceleration with dynamic sparse attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.693578Z"},"links":{"cited_paper":"/paper/2110.11299","citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:1f0077b4ffdc84a34188702600ec25f8a478d9afc5dc200d284a012199dc3638","observation_id":"b689a940-afd1-4966-977d-1132fb5afa68","resolution":{"observed_at":"2026-08-09T14:38:49.693578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:38:50.333707Z","title":"Bit: Robustly binarized multi-distilled transformer","venue":null,"work_id":"05f8907f-e87c-4058-bc08-4039c9f50880","year":2022},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.696818Z"},"links":{"citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:57ae80e423743cb38637c39a199bf6aec24703d78d0fe969512200f0c83bc3c0","observation_id":"5f80d868-7fa4-4504-885d-44af9c5f09f6","resolution":{"observed_at":"2026-08-09T14:38:50.365203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08608","last_updated":"2022-05-11T04:59:10Z","snapshot_observed_at":"2026-08-20T04:55:22.655396Z","submitted_at":"2021-12-16T04:14:38Z","title":"QuALITY: Question Answering with Long Input Texts, Yes!","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08608","snapshot_observed_at":"2026-08-09T14:38:49.700286Z","title":"Quality: Question answering with long input texts, yes! arXiv preprint arXiv:2112.08608, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.700286Z"},"links":{"cited_paper":"/paper/2112.08608","citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:94f7ddc006d8b9ee7d70afc9e070c80dadd51a44e13695a0193067b8792d32b4","observation_id":"b1c5a520-2fca-40e2-a5d4-c1cb7f057de6","resolution":{"observed_at":"2026-08-09T14:38:49.700286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:38:49.726182Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.726182Z"},"links":{"citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:4f0afa05c0257413dbc8d7be5d5b77a78171f6f2d36c17e67c0553d13c2126ad","observation_id":"41e878c0-ae5d-433c-b1fd-01237ade3d11","resolution":{"observed_at":"2026-08-09T14:38:49.726182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.02217","last_updated":"2021-04-28T07:24:49Z","snapshot_observed_at":"2026-08-13T03:08:20.485293Z","submitted_at":"2020-07-16T17:52:37Z","title":"Hopfield Networks is All You Need","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.02217","snapshot_observed_at":"2026-08-09T14:38:49.791911Z","title":"Hopfield networks is all you need","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.791911Z"},"links":{"cited_paper":"/paper/2008.02217","citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:880ee024aa85abdf9e56c3dfb1aa3838ed68e30a810f5f152e815ae172b3adde","observation_id":"0bc6496e-fd33-4345-bfa3-2af72836a718","resolution":{"observed_at":"2026-08-09T14:38:49.791911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:38:50.276135Z","title":"Xnor-net: Imagenet classifica- tion using binary convolutional neural networks","venue":null,"work_id":"8099db5b-3049-4ca8-be21-57a3b6b2b8dc","year":2016},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.806493Z"},"links":{"citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:6bca2db7472481ec2ff8069e3b30fca78fd73d5e5a37fe17159332be061905ea","observation_id":"8abd4172-985e-40b9-ad56-dde7503936e2","resolution":{"observed_at":"2026-08-09T14:38:50.287215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:38:50.204323Z","title":"XNOR-Net: Imagenet classifica- tion using binary convolutional neural networks","venue":null,"work_id":"564703fa-615d-4109-9158-efac0bc6c932","year":2016},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.827281Z"},"links":{"citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:8b3637b778e860f04f5940cd42555442b269f2771a57901aeb0d7b90f3f63034","observation_id":"df7b73f3-5567-4649-832f-f625e79e74de","resolution":{"observed_at":"2026-08-09T14:38:50.223753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:38:50.182820Z","title":"Efficient sparse-dense matrix-matrix multiplication on gpus us- ing the customized sparse storage format","venue":null,"work_id":"1b1bf7ed-46e4-427d-b65b-110b43cf76a0","year":2020},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.861360Z"},"links":{"citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:beab44674970dd0044d903ff79f03936e26b1f2cd6cadc2620cdceb0d342e80e","observation_id":"345b58c1-29c7-4575-bdcd-2b25e26a056e","resolution":{"observed_at":"2026-08-09T14:38:50.186783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:38:50.170704Z","title":"Sextans: A streaming accelerator for general-purpose sparse-matrix dense-matrix multiplication","venue":null,"work_id":"afbbfa79-c400-4654-bf08-145801be1781","year":2022},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.888701Z"},"links":{"citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:4c4365e23f7485d656c7ad6f893a27e31bab2c6b930f2f6b1ffb9c5ad35f12cd","observation_id":"e358aeb3-d645-4693-bc82-1871e48d7010","resolution":{"observed_at":"2026-08-09T14:38:50.174790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:38:50.159773Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"7e10dcbd-233d-4b24-922e-a8a127e249cc","year":2021},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.915271Z"},"links":{"citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:45871e8a0ca13acf364f17bac0882d7c9a9d70b3c5b671c8e22be9f92f6a4fd6","observation_id":"4eaa9b5f-5e40-4dee-940b-b7f313ec6eaa","resolution":{"observed_at":"2026-08-09T14:38:50.163641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:38:50.147996Z","title":"Attention is all you need","venue":null,"work_id":"5a305869-a377-4431-b9fe-97407e8dfd74","year":2017},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.919284Z"},"links":{"citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:dbb2514e6efa11f3e841d44e4ca3161c0fc587c48b41670586f2a0f02b6b748b","observation_id":"db93b213-b915-442a-8390-616bee382c13","resolution":{"observed_at":"2026-08-09T14:38:50.151803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.00335","last_updated":"2025-05-11T23:57:58Z","snapshot_observed_at":"2026-08-16T18:27:39.380785Z","submitted_at":"2021-05-01T19:38:30Z","title":"Audio Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.00335","snapshot_observed_at":"2026-08-09T14:38:49.922737Z","title":"Audio trans- formers: Transformer architectures for large scale au- dio understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.922737Z"},"links":{"cited_paper":"/paper/2105.00335","citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:7ffadb5130ed67d070a5fadb42a32313a0692cf44c254a7ac6fbb1db2521f9ac","observation_id":"c3ad2eac-9e10-4e3f-a17e-7b7b4312b389","resolution":{"observed_at":"2026-08-09T14:38:49.922737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-08-09T14:38:49.926693Z","title":"Linformer: Self-attention with linear com- plexity","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.926693Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:a03e51f34ea5e09e257a1d5c686a3b74d496248ed34f587229fe348f54c7ba32","observation_id":"688012e6-1b89-461a-b44b-fd1ec63f74e3","resolution":{"observed_at":"2026-08-09T14:38:49.926693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11295","last_updated":"2024-11-29T11:47:55Z","snapshot_observed_at":"2026-08-16T14:17:44.527552Z","submitted_at":"2024-02-17T14:26:57Z","title":"OneBit: Towards Extremely Low-bit Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11295","snapshot_observed_at":"2026-08-09T14:38:49.930687Z","title":"Onebit: Towards extremely low-bit large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.930687Z"},"links":{"cited_paper":"/paper/2402.11295","citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:e412b0ae0245ee6618a256fa4dc3a79e3b7d7c2991b6b9769b5e97fa78174524","observation_id":"32adf834-400b-4180-8ee8-7374a6b9e8db","resolution":{"observed_at":"2026-08-09T14:38:49.930687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:38:50.135682Z","title":"Pb- llm: Partially binarized large language models","venue":null,"work_id":"762a4218-2ed8-428c-aad1-885a68d09237","year":null},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.933991Z"},"links":{"citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:c9548bb7777a1a257dc1c54b2d4872f26ce34d26ffc692903536d88a5463b3a6","observation_id":"8ca2a554-0c2e-40b9-bcd7-7142221b8e17","resolution":{"observed_at":"2026-08-09T14:38:50.139820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:38:50.120929Z","title":"Big bird: Transformers for longer se- quences","venue":null,"work_id":"7db01b13-c61b-4843-93f7-f161c3134ba6","year":2020},"citing_paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T14:38:49.937475Z"},"links":{"citing_paper":"/paper/2502.01770"},"observation_digest":"sha256:016e4024330f37aa1b2f85256f2a35421675b35d22b3104855e27ce84cde8efa","observation_id":"45272873-b124-4ba1-9150-da2ebbe02e7c","resolution":{"observed_at":"2026-08-09T14:38:50.127043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.01770","last_updated":"2025-02-03T19:24:01Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T15:44:28.173429Z","submitted_at":"2025-02-03T19:24:01Z","title":"Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":22},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2502.01770."}