{"as_of":"2026-08-08T20:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b8b3a662219d26a58a3de3f53816b20508b3cce3ce5daa372d8c3aa3a1bc60eb","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:42:56.038504Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:10:59.474337Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T14:21:02.595394Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14840","snapshot_observed_at":"2026-08-07T15:10:59.474337Z","title":"Sub- quadratic algorithms and hardness for attention with any te mperature","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16284","last_updated":"2025-05-22T06:26:28Z","snapshot_observed_at":"2026-08-07T22:03:10.571335Z","submitted_at":"2025-05-22T06:26:28Z","title":"Only Large Weights (And Not Skip Connections) Can Prevent the Perils of Rank Collapse","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:59.474337Z"},"links":{"cited_paper":"/paper/2505.14840","citing_paper":"/paper/2505.16284"},"observation_digest":"sha256:c6c711b903586daa30b681c2070d7b82fed14f0d8a849eeaef034f2b999fa35a","observation_id":"e89f4b95-e4dd-4266-b404-8d946c58019e","resolution":{"observed_at":"2026-08-07T15:10:59.474337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"cited_work":{"arxiv_id":"2505.14840","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.14840","snapshot_observed_at":"2026-08-07T14:21:02.595394Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","venue":"cs.LG","work_id":"adfeef27-5a91-446a-b0f8-9874a6f023f4","year":2025},"citing_paper":{"arxiv_id":"2505.19531","last_updated":"2025-05-26T05:33:26Z","snapshot_observed_at":"2026-08-08T07:05:10.715675Z","submitted_at":"2025-05-26T05:33:26Z","title":"Minimalist Softmax Attention Provably Learns Constrained Boolean Functions","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:00.874738Z"},"links":{"cited_paper":"/paper/2505.14840","citing_paper":"/paper/2505.19531"},"observation_digest":"sha256:884c6696421c3eec5965317f84ee0075ef4723f2284ac8949e3597e41396a357","observation_id":"063b1293-4e99-4560-8953-4c1d2dd07be4","resolution":{"observed_at":"2026-08-07T14:21:02.673064Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14840/citation-record","integrity":"/paper/2505.14840/integrity","json":"/paper/2505.14840/citation-record.json","paper":"/paper/2505.14840"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:06.170821Z","title":"Optimal-degree polynomial approximations for exponentials and gaussian kernel density estimation","venue":null,"work_id":"2b31ee8a-cae4-4772-a792-93570705d213","year":2022},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:50.212020Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:ac2f515153818c8d15427cadeccf3bdc14af43c18f253e1322423b32cde85dab","observation_id":"cf9be8d4-929c-47ea-805f-5b2c3def07fb","resolution":{"observed_at":"2026-08-07T15:43:06.294252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:05.749804Z","title":"More asymmetry yields faster matrix multiplication","venue":null,"work_id":"7d3ef979-9a50-4e9d-a35b-d06b038f4c15","year":2025},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:50.263469Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:a3b6bbf10313c2a5987641263799ca3c302a674bdef6523bedbe00ef01def3df","observation_id":"eccc12aa-db0c-4c9f-a835-8fbd3ca266d5","resolution":{"observed_at":"2026-08-07T15:43:05.992417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:05.527324Z","title":"Agarwal, Herbert Edelsbrunner, Otfried Schwarzkopf, and Emo Welzl","venue":null,"work_id":"ed70a1fb-ea44-471a-a5de-b7b05ee00340","year":1991},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:50.396561Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:0c236c32240a01b9414285522998a26ba1a4e83fa811d61cebf560067266fa95","observation_id":"007036b9-dab1-4023-9d41-6dfc7128b05b","resolution":{"observed_at":"2026-08-07T15:43:05.607992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:05.233256Z","title":"Finer-grained hardness of kernel density estimation","venue":null,"work_id":"29a40545-13ad-408e-aeb7-58a42bebf846","year":2024},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:50.451427Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:e607e1280d8272015dd2ef7e80280af9b423b6a81e80ff5db6b194af4df00441","observation_id":"d27eb968-079b-41eb-bcfd-ecab3f0e7b28","resolution":{"observed_at":"2026-08-07T15:43:05.376900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:04.972255Z","title":"Fast attention requires bounded entries","venue":null,"work_id":"9be86d46-d59e-4249-ad04-e26a19a706c3","year":2024},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:50.566594Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:46ca27967791fb6772c45ab0932fd7a3b7e50481f6ad8c7b924b8bf4dd0d21b4","observation_id":"63f53770-77d3-45d4-b035-19fa442e27e1","resolution":{"observed_at":"2026-08-07T15:43:05.080898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04497","last_updated":"2024-02-07T00:45:31Z","snapshot_observed_at":"2026-08-08T18:00:07.960386Z","submitted_at":"2024-02-07T00:45:31Z","title":"The Fine-Grained Complexity of Gradient Computation for Training Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04497","snapshot_observed_at":"2026-08-07T15:42:50.649122Z","title":"The fine-grained complexity of gradient computation for training large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:50.649122Z"},"links":{"cited_paper":"/paper/2402.04497","citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:c099e831664c0e7ec120dfbb6336ce6a3ed1828e284f208f3661d2499f4d7dfb","observation_id":"636e0c95-4aee-498a-ae0c-ceeb56d11482","resolution":{"observed_at":"2026-08-07T15:42:50.649122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:04.769749Z","title":null,"venue":null,"work_id":"8c68267e-b8ce-4dec-a467-fa4e996f7c9a","year":2023},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:50.702972Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:12801d171c268c582f1067fa7e5447a6de1072b74648d5803ad2d6062a6171d2","observation_id":"94a91b4a-c14f-4165-ba9f-06ec29bbc24c","resolution":{"observed_at":"2026-08-07T15:43:04.876681Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:04.529464Z","title":"More applications of the polynomial method to algorithm design","venue":null,"work_id":"5866ed8d-2bae-46bb-9229-a4df30b33d87","year":2015},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:50.795404Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:9936f74c809ed7339b81805054cd4d52c28c7eed466c1f49c33567257262b1b3","observation_id":"85f6b080-20cf-4383-aace-4f2a271e4fcf","resolution":{"observed_at":"2026-08-07T15:43:04.606870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:04.345270Z","title":"More applications of the polynomial method to algorithm design","venue":null,"work_id":"55113d7c-079c-48ca-b48c-b004335b0a60","year":2015},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:50.947012Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:6faaf91e48a49b12c502bd5aad9ff3008ae4446adce1659699ff4d18ff21c4c7","observation_id":"9e1b531c-d10c-4f9e-af6e-2f33da3e05c2","resolution":{"observed_at":"2026-08-07T15:43:04.426903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:51.050607Z","title":"Fundamental limitations on subquadratic alternatives to transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:51.050607Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:a3fb89e79eddbac1185e2838c25cc25533b674013aaa00449ed36d2be16a47dc","observation_id":"4fdf8855-638b-4b31-993c-ff75e112c908","resolution":{"observed_at":"2026-08-07T15:42:51.050607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:04.215613Z","title":"Edit distance cannot be computed in strongly subquadratic time (unless SETH is false)","venue":null,"work_id":"b05b5a65-865c-456d-a21b-5a05feed7e34","year":2018},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:51.145448Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:74696952dd0f016e5cd1f2d2f87180f00c662ec566c05e4230896c6b09015823","observation_id":"3c46e104-686a-4983-8536-697d30f67d93","resolution":{"observed_at":"2026-08-07T15:43:04.257153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:03.965431Z","title":null,"venue":null,"work_id":"01f3940f-daef-49e7-856a-eee1ddd0dbe9","year":2020},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:51.220065Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:0cb3fcdbe5d2bef2a7e7bd5b0e911f54a66b5be85c641e8a2b3eeb6d663b054e","observation_id":"fa974cf9-92d3-4d27-a240-3dc36b6c16ec","resolution":{"observed_at":"2026-08-07T15:43:04.090036Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02207","last_updated":"2023-04-05T03:43:38Z","snapshot_observed_at":"2026-08-05T13:33:02.149756Z","submitted_at":"2023-04-05T03:43:38Z","title":"Algorithm and Hardness for Dynamic Attention Maintenance in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02207","snapshot_observed_at":"2026-08-07T15:42:51.308081Z","title":"Algorithm and hardness for dynamic attention maintenance in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:51.308081Z"},"links":{"cited_paper":"/paper/2304.02207","citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:287b42f3162b213f3b88fb666d5e58ee06ce8b94c96a1ffd057ba8aa4b4f841e","observation_id":"0b4b1022-fedd-4ef0-99b3-892349274850","resolution":{"observed_at":"2026-08-07T15:42:51.308081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:03.809217Z","title":"Scatterbrain: Unifying sparse and low-rank attention","venue":null,"work_id":"2f0426cd-9915-41b7-acb0-0ea48d8d6c75","year":2021},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:51.424750Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:28dad5b3da462fb4d605b5b61ff5facdb7ed29bf239ce4e4dc83f117a857b142","observation_id":"420a362f-9cb1-4d1a-bd2b-56333775d765","resolution":{"observed_at":"2026-08-07T15:43:03.904261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:03.521886Z","title":"On the hardness of approximate and exact (bichromatic) maximum inner product","venue":null,"work_id":"e1c90140-6938-4e5d-9250-c88750d16571","year":2018},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:51.530306Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:e9449f2340e88d3c3b2701b7c9645f36a7fbd25f08df26c16fdd8f5a2512a9d9","observation_id":"71d2839d-0e94-4490-bb2e-e77f49194bb9","resolution":{"observed_at":"2026-08-07T15:43:03.689280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:03.353635Z","title":null,"venue":null,"work_id":"817b9339-4874-457a-8c5c-4c0d099869e8","year":2020},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:51.697517Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:622184fe4c0b3b1979bece66757bb86a981200188e85fb2bde5f6bbeec5b4941","observation_id":"7f6106ef-69b8-4f42-84dd-eef3a90edc99","resolution":{"observed_at":"2026-08-07T15:43:03.453510Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:03.136415Z","title":"Colwell, and Adrian Weller","venue":null,"work_id":"30f56386-7a1f-4aa5-b9df-10dfca54fcb7","year":2021},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:51.806676Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:561bfc326a20987a03936e576cff0548ab7b0960bc89d0c1fbff5440f2c2b519","observation_id":"4ead6a3c-60a7-464e-8b30-b6ab0957472e","resolution":{"observed_at":"2026-08-07T15:43:03.211547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:02.935541Z","title":"Chan and Ryan Williams","venue":null,"work_id":"ae7b0822-c307-4635-aac0-85d4587b999e","year":2016},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:51.920588Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:c127b024fd9547bd8b43be453f5af3393399edada8446cfeda081fdafe6223a1","observation_id":"be6b873c-b514-4a07-822b-06eefd18f82e","resolution":{"observed_at":"2026-08-07T15:43:03.054742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:02.712909Z","title":"Approximation algorithms for min-distance problems in dags","venue":null,"work_id":"7e68ea43-2efa-4818-b354-859bd252ced1","year":2021},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:52.078585Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:872a905362adc3ccb25bf2db0d80ff0c5b33cbe7f4838ccf7a07252206b125d5","observation_id":"b28b81d7-f8dd-4166-96a4-f4bdbcecfbd9","resolution":{"observed_at":"2026-08-07T15:43:02.814751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07418","last_updated":"2023-09-14T04:23:40Z","snapshot_observed_at":"2026-07-06T16:18:17.458740Z","submitted_at":"2023-09-14T04:23:40Z","title":"A Fast Optimization View: Reformulating Single Layer Attention in LLM Based on Tensor and SVM Trick, and Solving It in Matrix Multiplication Time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07418","snapshot_observed_at":"2026-08-07T15:42:52.220796Z","title":"A fast optimization view: Reformulating single layer attention in llm based on tensor and svm trick, and solving it in matrix multiplication time","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:52.220796Z"},"links":{"cited_paper":"/paper/2309.07418","citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:2dc22dd68ee814de23bdfc7e4b4714c3b069686defc2dfe3347e0fd3d94f8ece","observation_id":"477ac53f-f88c-4aa6-ab43-da5744a65aa8","resolution":{"observed_at":"2026-08-07T15:42:52.220796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:52.325301Z","title":"Fast quantum algorithm for attention computation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:52.325301Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:d8db70e18525f1c32ab1be0a46b2821a2ee29ac52b84ea54fabd357504cdd057","observation_id":"8217d114-3f3d-492a-82a0-c0f4bc1a114b","resolution":{"observed_at":"2026-08-07T15:42:52.325301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04701","last_updated":"2024-10-14T15:52:31Z","snapshot_observed_at":"2026-08-07T14:28:09.592784Z","submitted_at":"2023-05-08T13:32:41Z","title":"Differentially Private Attention Computation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04701","snapshot_observed_at":"2026-08-07T15:42:52.462000Z","title":"Differentially private attention computation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:52.462000Z"},"links":{"cited_paper":"/paper/2305.04701","citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:b8db02501cccf0ac31a292ba9fea8adc3808a707df3db7489a19dcab3330c139","observation_id":"799a7b38-a586-4eeb-b831-df2531f5fef1","resolution":{"observed_at":"2026-08-07T15:42:52.462000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:52.585794Z","title":"Hyperattention: Long-context attention in near-linear time","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:52.585794Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:4b30ae71fc3f323249f022aa0471a2fbc043336fd4df628cc9820a6a92d25207","observation_id":"12f3d788-0006-4ce1-965a-49a7a0f3a83f","resolution":{"observed_at":"2026-08-07T15:42:52.585794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:02.408490Z","title":"Singular value decomposition (svd)","venue":null,"work_id":"f066107d-f7e4-4922-908a-5bc8f9cbd484","year":2024},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:52.686450Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:eb54215f2b92658a40f08e12f2784392dcb1713b227fe878e6cecff8f69dec82","observation_id":"c5a46af3-c0b8-46df-9430-68a207c9b6b8","resolution":{"observed_at":"2026-08-07T15:43:02.532270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:02.164097Z","title":"Adco: Adversarial contrast for efficient learning of unsupervised representations from self-trained negative adversaries","venue":null,"work_id":"edbe2bf7-4db3-4704-9274-66055a4f3996","year":2021},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:52.896302Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:fbfc6a72efd17f59227c2f3a9a3187cf3d9b21cd98c3f971c37541e7f77c9856","observation_id":"f33c69ca-bbbc-4449-88b3-0cc493bd2fc1","resolution":{"observed_at":"2026-08-07T15:43:02.254890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:53.035468Z","title":"On the complexity of k-sat","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:53.035468Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:80f4492c2d065045b1f3d1494b6ca99a8bb27824fe71a779464ac537df70f330","observation_id":"96368467-d70c-4dca-ae4e-bc96ba646f6b","resolution":{"observed_at":"2026-08-07T15:42:53.035468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:01.901733Z","title":"Dynamic temperature scaling in contrastive self-supervised learning for sensor-based human activity recognition","venue":null,"work_id":"edcfbc44-3f30-478d-a09c-8099194906fb","year":2022},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:53.137958Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:610277221a9ba23419f50e7267f46c26363e7291d4d0e10327e1df41b09d26d8","observation_id":"f1a1b9e0-a91d-42a1-8389-6650a5f42e80","resolution":{"observed_at":"2026-08-07T15:43:02.027581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:01.671544Z","title":"Temperature schedules for self-supervised contrastive methods on long-tail data","venue":null,"work_id":"9f9ef3da-730e-4d0b-877c-6b2141725560","year":2023},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:53.247265Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:fc233938d06647791c6a1bc8e13ec02f00e7dd78136ee9a5ab1c72a8f55ee7c9","observation_id":"4bdda98e-8538-444b-af14-dfdacc69668d","resolution":{"observed_at":"2026-08-07T15:43:01.785805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:01.437273Z","title":"Reformer: The efficient transformer","venue":null,"work_id":"c1ee6a80-6f64-4c70-8277-67cb04397e89","year":2020},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:53.336694Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:0373665817e9cf9e602d01b058a80564092e6d83f67f3ffc0b48084f485e41ab","observation_id":"aebff8fb-1c35-4dd1-a2fc-0b7d5e984509","resolution":{"observed_at":"2026-08-07T15:43:01.544849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:01.197679Z","title":"Polysketchformer: Fast transformers via sketching polynomial kernels","venue":null,"work_id":"033f3ee3-d619-43db-a671-8b1ee20ca3c9","year":2024},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:53.464406Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:ad5ddde7ead28ca379f0173fbbd42f642409f99f642514747dc646a6faad91e3","observation_id":"c6017b96-d216-4211-a165-0b5c5ed760b5","resolution":{"observed_at":"2026-08-07T15:43:01.286407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:00.966049Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":null,"work_id":"5a0b0ffc-ac19-4503-94c8-9cf6d0dc3938","year":2020},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:53.547454Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:ffb3227bdc1a0402aac1b0f60f33b83c09ada5e7ec03dca453bdd33238c90159","observation_id":"ac6abbbd-40e5-4ae4-a7a2-464ba15f3ba9","resolution":{"observed_at":"2026-08-07T15:43:01.075432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:00.810808Z","title":"On the computational complexity of self-attention","venue":null,"work_id":"e9edd15d-becf-464e-8be1-3e0b0cebda0a","year":2023},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:53.641191Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:1d57fbc104b1ff6c7bf49167aafd6f7184d97fadae88fe4b34ff020a0cc06dd9","observation_id":"1ba79cb2-c871-4351-aff7-15d22112c230","resolution":{"observed_at":"2026-08-07T15:43:00.876464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:00.611757Z","title":"Efficient partition trees","venue":null,"work_id":"428ef31b-eb7e-4d12-ba46-c15e29a5174a","year":1992},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:53.726812Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:65476da93bfe59b2a940f71b12505bbfe40a7ad354e9607622e134aff130a89c","observation_id":"86ef437b-7541-4a68-be29-d5eb9070577f","resolution":{"observed_at":"2026-08-07T15:43:00.721005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01140","last_updated":"2024-05-10T17:26:36Z","snapshot_observed_at":"2026-07-06T16:01:37.986031Z","submitted_at":"2023-08-02T13:31:41Z","title":"Dynamically Scaled Temperature in Self-Supervised Contrastive Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01140","snapshot_observed_at":"2026-08-07T15:42:53.905463Z","title":"Dystress: Dynamically scaled temperature in self-supervised contrastive learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:53.905463Z"},"links":{"cited_paper":"/paper/2308.01140","citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:2637c902c9469242dc26ad4d86362ca316e89e8432f19f75239f4e430b8bed6d","observation_id":"e6c2f0df-64b6-414c-851c-0423c5980030","resolution":{"observed_at":"2026-08-07T15:42:53.905463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:00.453959Z","title":"Fine-tuning language models with just forward passes","venue":null,"work_id":"f703b4f5-395f-4cea-97e4-f73308ddfe17","year":2023},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:54.032189Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:573b5d1446b358226e9d44172a10fcca011a488b8f31858a08e404504e4170a3","observation_id":"4f3c905d-e20d-4b32-b973-baad50c3aaa3","resolution":{"observed_at":"2026-08-07T15:43:00.503433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:00.182869Z","title":"Trainable transformer in transformer","venue":null,"work_id":"c2970449-f46e-45b7-b754-3997c58fca2c","year":2023},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:54.101261Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:1d59c02bf40e4a32d061fd431c803a7ec4bc3bd8b33b1ecb5c6013de36959418","observation_id":"160bfaa0-32b6-4a06-8a8e-93ef69ccae94","resolution":{"observed_at":"2026-08-07T15:43:00.379862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:59.936946Z","title":"Can contrastive learning avoid shortcut solutions? In Advances in Neural Information Processing Systems NeurIPS 34 , 2021","venue":null,"work_id":"1c40aa20-c150-46aa-b5f5-9f919448361e","year":2021},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:54.217960Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:5819c1632125d7a866a2c19e67b63f231ad841c1092424e6f061798432c852e8","observation_id":"8e633a9c-3926-4abd-931c-6eab39c045a7","resolution":{"observed_at":"2026-08-07T15:43:00.044207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:59.729979Z","title":"The singular value decomposition (svd) and low-rank matrix approximations","venue":null,"work_id":"cc0e9897-c387-4e8c-a3af-c8aa91700414","year":2024},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:54.325768Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:d76d0e42d26888d998bba57d17b444ad6d00af999696ab15e01932a7d10da86b","observation_id":"ad99f3c8-3d9d-4cfa-ab88-6322479b0cad","resolution":{"observed_at":"2026-08-07T15:42:59.800394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:59.507659Z","title":"Fast approximation algorithms for the diameter and radius of sparse graphs","venue":null,"work_id":"b65a29c6-66db-4d82-8c78-d85aaf7836e3","year":2013},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:54.408501Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:1eb68bb3194f3f9dd820c19afdfcb81477f1db29602f0d1e74a9715160e8dc7e","observation_id":"8eb03f50-1dfd-488e-b2bb-85b5af44c0ba","resolution":{"observed_at":"2026-08-07T15:42:59.622423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:59.186084Z","title":"Understanding transformer reasoning capabilities via graph algorithms","venue":null,"work_id":"42b3d0b4-a97c-4781-b7cc-a38fdd329fd3","year":2024},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:54.529794Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:74308be40439e0bcb79bd6982cd0b41db305be5b9a78f2591e77fd369783978a","observation_id":"d8d15c9d-a049-4b43-a4a0-a590fd699371","resolution":{"observed_at":"2026-08-07T15:42:59.366698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:58.843923Z","title":"Hsu, and Matus Telgarsky","venue":null,"work_id":"39fdd74d-ea57-4c9a-8811-f004e4ae401a","year":2023},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:54.668131Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:b7cc7e7fe73ae4cea687e8fadd325d36cbc9d79c7280f6d9b70b40ae40773d75","observation_id":"1e9b2544-6d54-492a-96c9-5de3a69add48","resolution":{"observed_at":"2026-08-07T15:42:58.990886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:58.637437Z","title":"Transformers, parallel computation, and logarithmic depth","venue":null,"work_id":"b2eef43f-25c1-4007-b012-33f6e315460c","year":2024},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:54.740302Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:049d0866e51e043ae8107ce03ec772aa50118fe0b7be153687e3e5dd65904263","observation_id":"228b1592-be39-4cbe-a5a5-6018d1630d40","resolution":{"observed_at":"2026-08-07T15:42:58.730020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:58.360236Z","title":"I / O complexity of attention, or how optimal is F lash A ttention? In Proceedings of the 41st International Conference on Machine Learning , 2024","venue":null,"work_id":"c75d4f3e-1b88-48ea-8469-f5b9349c1332","year":2024},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:54.836435Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:1c668a91b9cda1e390187dc7f387bbf6ba5194ca0cc009696b8b510f7daa98c0","observation_id":"54cbe930-4419-42da-8403-23df6ae03bf4","resolution":{"observed_at":"2026-08-07T15:42:58.506938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:58.017735Z","title":"Solving attention kernel regression problem via pre-conditioner","venue":null,"work_id":"0d9713d2-ff6c-4784-af8b-4bcd8c2fae2f","year":2024},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:54.937026Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:5fc019db13e3a9b15369bd7b554b4550bf0a3ff95203f44998cfc84b8228de5d","observation_id":"4417aab9-c5d8-40a0-93e0-a8b6a684cb36","resolution":{"observed_at":"2026-08-07T15:42:58.106015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:57.726334Z","title":"All pairs shortest paths in undirected graphs with integer weights","venue":null,"work_id":"5f03831b-7fa6-438e-a660-7272774622be","year":1999},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:55.049039Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:14d9b79a56c362a99241fafcf91c9c6d48db6535dd64890086e831f34ab1150b","observation_id":"96a1a9e8-9f30-4ab7-a05a-02346c063cbc","resolution":{"observed_at":"2026-08-07T15:42:57.846921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:57.479523Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"4f85fe8d-4d5b-4c9f-9bf0-20db575abd7e","year":2017},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:55.118698Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:f9166464c1a8270124a093d4d95ac2b40b4c192943ce511004e7805bd402131f","observation_id":"fa768160-b9b3-4b0c-8c0d-ad5a47d6e672","resolution":{"observed_at":"2026-08-07T15:42:57.635726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:57.227309Z","title":"Understanding contrastive representation learning through alignment and uniformity on the hypersphere","venue":null,"work_id":"f326a563-a196-4118-81c2-ded2dde0de5e","year":2020},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:55.252685Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:c177af1d6ce47f4cbcc9c18fa9013ffc86b647761a8ebad87211d98c067f8c75","observation_id":"3cb3c2a5-da3a-44a7-b740-a6787bee2fb0","resolution":{"observed_at":"2026-08-07T15:42:57.346080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:56.967655Z","title":"A new algorithm for optimal constraint satisfaction and its implications","venue":null,"work_id":"d5332f02-2fce-4a77-a53e-942b19510ef3","year":2004},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:55.424063Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:df7d9f4b9f120bc38786be579321095175dac45eee59f33bb203997e77d397df","observation_id":"d18e179c-ad43-426c-b11e-2ba09960552f","resolution":{"observed_at":"2026-08-07T15:42:57.054364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:56.862731Z","title":"Ryan Williams","venue":null,"work_id":"7699da1b-0988-40d0-8d52-d43709facf45","year":2018},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:55.543446Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:ea79b54351e9a5dc86d9dba2b375aacca53186b18b8fb4e14f60e8491122bfcc","observation_id":"8f264577-561f-4f79-9797-4b50ff79d5cf","resolution":{"observed_at":"2026-08-07T15:42:56.936522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:56.706244Z","title":"Understanding the behaviour of contrastive loss","venue":null,"work_id":"4f6fcf0d-2617-4cb3-a3fd-59b7d845e12c","year":2021},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:55.641313Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:04ab16293aec1a3297ae966a1d64154ff87a9651477fe68484c6dbf307da002a","observation_id":"2cecae4b-471b-40ee-91c0-f978a17b8cfb","resolution":{"observed_at":"2026-08-07T15:42:56.763351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20604","last_updated":"2025-02-28T00:07:45Z","snapshot_observed_at":"2026-08-07T17:41:22.955809Z","submitted_at":"2025-02-28T00:07:45Z","title":"Exploring the Impact of Temperature Scaling in Softmax for Classification and Adversarial Robustness","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20604","snapshot_observed_at":"2026-08-07T15:42:55.696237Z","title":"Exploring the impact of temperature scaling in softmax for classification and adversarial robustness","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:55.696237Z"},"links":{"cited_paper":"/paper/2502.20604","citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:bbf15b0930ba5f2e559fdbed19b77c95128998bd2decac3857c34071d7b302c6","observation_id":"f1fe6883-1b81-48c4-80e0-712940b5de1e","resolution":{"observed_at":"2026-08-07T15:42:55.696237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:56.584446Z","title":"On constructing minimum spanning trees in k-dimensional spaces and related problems","venue":null,"work_id":"36659861-fc21-4444-98d3-bdb711b44048","year":1982},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:55.771449Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:feb22e6d92099e88b2a1abed031f018dfb197803f1fd7cf854cc15bc165d1932","observation_id":"e681278f-1bcd-435e-a8bb-e59bc83e1b75","resolution":{"observed_at":"2026-08-07T15:42:56.647695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01805","last_updated":"2026-06-17T11:42:47Z","snapshot_observed_at":"2026-08-07T17:32:44.612536Z","submitted_at":"2025-03-03T18:33:58Z","title":"Depth-Width tradeoffs in Algorithmic Reasoning of Graph Tasks with Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01805","snapshot_observed_at":"2026-08-07T15:42:55.833385Z","title":"Depth-width tradeoffs in algorithmic reasoning of graph tasks with transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:55.833385Z"},"links":{"cited_paper":"/paper/2503.01805","citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:b6cd139fc89d366b6b23f0c170aa6ff435a39f9deaadaf5cdedeb83c410864c0","observation_id":"9eab0b74-f8f8-4aa0-8d99-4d97292a4159","resolution":{"observed_at":"2026-08-07T15:42:55.833385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:56.446359Z","title":"Big bird: Transformers for longer sequences","venue":null,"work_id":"2f5dc47f-ddb9-4317-b541-7bdc158bf6ae","year":2020},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:55.913849Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:258a1b8a060e8dfdf49b7a5a487e15c643a283d3d4c63a34a1e4271cf7de38d3","observation_id":"8b4b64dc-4ecf-4041-bb73-bdaa610e13af","resolution":{"observed_at":"2026-08-07T15:42:56.507359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:56.313561Z","title":"Kdeformer: Accelerating transformers via kernel density estimation","venue":null,"work_id":"7d69e849-c548-4a0e-a5e0-8552c3ecd38f","year":2023},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:55.976518Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:fbe19958a28977094480fbfdb897ddd78b9ba01205d032364610005515dbb2c1","observation_id":"3accb36a-a310-4010-88b2-ca9386b7f40f","resolution":{"observed_at":"2026-08-07T15:42:56.363767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:56.038504Z","title":"All pairs shortest paths using bridging sets and rectangular matrix multiplication","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:56.038504Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:6a353aed68c53e1f715a084a5549ab4cfa9a54c1900330c8ac5eb809c741172a","observation_id":"0ee2aab9-5aac-4e8b-b1e9-5acf4eee16eb","resolution":{"observed_at":"2026-08-07T15:42:56.038504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":41},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 2 inbound Pith citation observations for arXiv:2505.14840."}