{"as_of":"2026-08-15T14:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5a420a907da31eec11e0bdb23edb78354d2fee99d8ec0a3be763e8391541ebae","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:46:51.764217Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T04:54:36.267061Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T16:27:09.092002Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07814","snapshot_observed_at":"2026-08-03T04:54:36.267061Z","title":"Yudin, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04078","last_updated":"2026-07-10T09:47:30Z","snapshot_observed_at":"2026-08-06T18:13:09.718759Z","submitted_at":"2026-02-03T23:30:08Z","title":"Principles of Lipschitz continuity in neural networks","version":2},"reference_index":225,"source":"arxiv_source","source_observed_at":"2026-08-03T04:54:36.267061Z"},"links":{"cited_paper":"/paper/2507.07814","citing_paper":"/paper/2602.04078"},"observation_digest":"sha256:7ef21f90e48d1bbd8869175faf549173b2a0ed6af94019070a797111f6652747","observation_id":"433f8d19-c98a-4500-a95b-2db8facdfab6","resolution":{"observed_at":"2026-08-03T04:54:36.267061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"cited_work":{"arxiv_id":"2507.07814","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07814","snapshot_observed_at":"2026-08-10T01:13:53.509299Z","title":"Pay attention to attention distribution: A new lo- cal lipschitz bound for transformers","venue":null,"work_id":"bb846013-c7a8-4008-8b5f-1849e8605ba0","year":2025},"citing_paper":{"arxiv_id":"2604.11791","last_updated":"2026-04-13T17:55:36Z","snapshot_observed_at":"2026-08-12T01:14:28.635355Z","submitted_at":"2026-04-13T17:55:36Z","title":"A Mechanistic Analysis of Looped Reasoning Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:19.680424Z"},"links":{"cited_paper":"/paper/2507.07814","citing_paper":"/paper/2604.11791"},"observation_digest":"sha256:32c286becff1a134b6796d40ab210866d22ecf52d9d24d8f059ddd2ffcb41160","observation_id":"7b25e135-81a5-4a00-9d06-5c962785b0d8","resolution":{"observed_at":"2026-08-10T01:13:53.509299Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"cited_work":{"arxiv_id":"2507.07814","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07814","snapshot_observed_at":"2026-08-10T01:13:53.509299Z","title":"Pay attention to attention distribution: A new lo- cal lipschitz bound for transformers","venue":null,"work_id":"bb846013-c7a8-4008-8b5f-1849e8605ba0","year":2025},"citing_paper":{"arxiv_id":"2604.17384","last_updated":"2026-04-19T11:18:03Z","snapshot_observed_at":"2026-08-14T23:13:02.286205Z","submitted_at":"2026-04-19T11:18:03Z","title":"Towards a Data-Parameter Correspondence for LLMs: A Preliminary Discussion","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T06:08:29.034434Z"},"links":{"cited_paper":"/paper/2507.07814","citing_paper":"/paper/2604.17384"},"observation_digest":"sha256:b0e236c1020f603c5c02b380c8ea0073d0d845e2efe622e0858102c056c6bfe9","observation_id":"24787a95-7869-4e9b-b0e2-3d70b3323fad","resolution":{"observed_at":"2026-08-10T01:13:53.509299Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"cited_work":{"arxiv_id":"2507.07814","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07814","snapshot_observed_at":"2026-08-10T01:13:53.509299Z","title":"Pay attention to attention distribution: A new lo- cal lipschitz bound for transformers","venue":null,"work_id":"bb846013-c7a8-4008-8b5f-1849e8605ba0","year":2025},"citing_paper":{"arxiv_id":"2606.07684","last_updated":"2026-06-05T02:46:04Z","snapshot_observed_at":"2026-08-08T05:48:50.883642Z","submitted_at":"2026-06-05T02:46:04Z","title":"Semantic Cache Distillation: Efficient State Transfer via Reuse and Selective Patching","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-06-27T22:43:25.637631Z"},"links":{"cited_paper":"/paper/2507.07814","citing_paper":"/paper/2606.07684"},"observation_digest":"sha256:e6c76435cd8063a4ea6e603084413b47114a649f690b9b113ed54b51f9ac3887","observation_id":"429e813a-1482-47c7-9153-d81e9177abca","resolution":{"observed_at":"2026-08-10T01:13:53.509299Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.07814/citation-record","integrity":"/paper/2507.07814/integrity","json":"/paper/2507.07814/citation-record.json","paper":"/paper/2507.07814"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:52.689685Z","title":"Transformers and large language models for chemistry and drug discovery","venue":null,"work_id":"e336fc82-d0e1-4600-a6ea-a10e02b510e4","year":2024},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.501443Z"},"links":{"citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:8c40ce9c51a4275a998419fec78bb14f10f6ea648338384ea9230fe4c63c059e","observation_id":"a3594d00-1a25-4d67-8587-820c6bf3428d","resolution":{"observed_at":"2026-08-06T18:46:52.698643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19587","last_updated":"2025-06-06T20:57:10Z","snapshot_observed_at":"2026-08-13T17:54:06.151078Z","submitted_at":"2025-02-26T22:00:22Z","title":"NeoBERT: A Next-Generation BERT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19587","snapshot_observed_at":"2026-08-06T18:46:51.508757Z","title":"Neobert: A next-generation bert","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.508757Z"},"links":{"cited_paper":"/paper/2502.19587","citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:0ec8fa971978289764367c78a4983120c61aa6d545165149879f8d3b77b132da","observation_id":"593c5071-175e-49d2-a001-657920763c47","resolution":{"observed_at":"2026-08-06T18:46:51.508757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:51.515685Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.515685Z"},"links":{"citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:5f5e67646414f724d5a1686e300826e60ef59fdfbce27456eee5dead7d116904","observation_id":"e2058d93-9ceb-4653-a9e6-01baea4aee19","resolution":{"observed_at":"2026-08-06T18:46:51.515685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14820","last_updated":"2024-06-04T15:51:36Z","snapshot_observed_at":"2026-08-14T19:23:30.835889Z","submitted_at":"2023-12-22T16:47:10Z","title":"How Smooth Is Attention?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14820","snapshot_observed_at":"2026-08-06T18:46:51.523721Z","title":"How smooth is attention? arXiv preprint arXiv:2312.14820, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.523721Z"},"links":{"cited_paper":"/paper/2312.14820","citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:d45e77e932dc4d89262f1434752e11f45c1f8e07bbfa5e35bfdc49418a3806fe","observation_id":"2e35bfe4-9551-431f-afd1-6be179ed9eb5","resolution":{"observed_at":"2026-08-06T18:46:51.523721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:51.530782Z","title":"Reliable evaluation of adversarial robustness with an ensemble of diverse parameter-free attacks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.530782Z"},"links":{"citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:37dcd51deec473efd863ad19b98d77c7802b0ad6430697fc8bf492813e164ddc","observation_id":"cd72cfe1-87a2-4e3c-9f6c-732264a66ba2","resolution":{"observed_at":"2026-08-06T18:46:51.530782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:52.645862Z","title":"Lipschitz normalization for self-attention layers with application to graph neural networks","venue":null,"work_id":"63b0c64e-751b-40da-9b2b-d31a3e278b4e","year":2021},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.538268Z"},"links":{"citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:fb7cd333fd420a17ef3eb28025a2108c82daadbd320c2c840c2ff077a3933ead","observation_id":"836f1834-60fa-4c79-a28d-4e4b8b6a8abc","resolution":{"observed_at":"2026-08-06T18:46:52.651632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11668","last_updated":"2021-12-22T05:04:41Z","snapshot_observed_at":"2026-08-13T17:10:21.665481Z","submitted_at":"2021-12-22T05:04:41Z","title":"How Should Pre-Trained Language Models Be Fine-Tuned Towards Adversarial Robustness?","version":1},"cited_work":{"arxiv_id":"2112.11668","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.11668","snapshot_observed_at":"2026-08-06T18:46:52.316056Z","title":"How Should Pre-Trained Language Models Be Fine-Tuned Towards Adversarial Robustness?","venue":"cs.CL","work_id":"df7d59c8-d0ee-4ff4-998c-017c3496edb3","year":2021},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.546102Z"},"links":{"cited_paper":"/paper/2112.11668","citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:e3bd7d9bcb1775470f5d1b131045ee2a2215b3c0c38ee41ba4b17cbb2b0ca806","observation_id":"7fb2a085-45bf-467b-b2aa-1cfc734151b8","resolution":{"observed_at":"2026-08-06T18:46:52.322276Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:52.625621Z","title":"Attention is not all you need: pure ttention loses rank doubly exponentially with depth","venue":null,"work_id":"819db158-5a74-43d5-b50a-27e550560ebd","year":2021},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.553989Z"},"links":{"citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:3fdf27d3e50cbb50b97bb14ff8ea51f81b51fed382789951c5157d49aad9ca6f","observation_id":"47e84c70-25c0-49df-843d-2343c1fbfdbd","resolution":{"observed_at":"2026-08-06T18:46:52.632975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T18:46:51.561178Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.561178Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:1f1821543146898c2ee7554e06b7dd5ac5b376b9c5ef1d930e6f164450df764b","observation_id":"214dc63e-5efc-466d-909d-77c51c83d7c5","resolution":{"observed_at":"2026-08-06T18:46:51.561178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:51.568304Z","title":"EDIT: Enhancing vision transformers by mitigating attention sink through an encoder-decoder architecture","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.568304Z"},"links":{"citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:46956fb551277fd80ea2e2eccd6163acd03982c6c0ee8555ced172c3422a08a1","observation_id":"15e2e45f-101d-486b-b684-2129e296937c","resolution":{"observed_at":"2026-08-06T18:46:51.568304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00805","last_updated":"2018-08-21T00:02:44Z","snapshot_observed_at":"2026-08-14T21:08:29.545204Z","submitted_at":"2017-04-03T20:50:29Z","title":"On the Properties of the Softmax Function with Application in Game Theory and Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00805","snapshot_observed_at":"2026-08-06T18:46:51.575245Z","title":"On the properties of the softmax function with application in game theory and reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.575245Z"},"links":{"cited_paper":"/paper/1704.00805","citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:234b93e08201f8f85039088cbd42cb601faf4177b187d73f41044c69a4fad203","observation_id":"ca8ca0de-7a68-4dc9-86a9-d4f7bff1521e","resolution":{"observed_at":"2026-08-06T18:46:51.575245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:51.583140Z","title":"Regularisation of neural networks by enforcing lipschitz continuity","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.583140Z"},"links":{"citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:ddabaa5b0be4be7921cf1f2b2e3284c1c4519f0fa1157beda1e06aadb73012a6","observation_id":"e9d470f3-5826-4f34-bbcd-0278672a9848","resolution":{"observed_at":"2026-08-06T18:46:51.583140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10781","last_updated":"2025-03-02T14:37:53Z","snapshot_observed_at":"2026-08-02T20:46:05.666977Z","submitted_at":"2024-10-14T17:50:28Z","title":"When Attention Sink Emerges in Language Models: An Empirical View","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10781","snapshot_observed_at":"2026-08-06T18:46:51.589737Z","title":"When attention sink emerges in language models: An empirical view","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.589737Z"},"links":{"cited_paper":"/paper/2410.10781","citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:b70be895bb59f8f18a2c7f1f1d96344dc631ff4c1acb994bf7ba251e3e71b9d9","observation_id":"ab018f7c-6959-40c0-89c5-65904106ae02","resolution":{"observed_at":"2026-08-06T18:46:51.589737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:52.585611Z","title":"Transformer training instability of softmax and lipschitz- kernel attentions, 2024","venue":null,"work_id":"b1f12bf9-fe53-4930-bfdb-a08ea267ec1c","year":2024},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.596199Z"},"links":{"citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:200cb186fbd14a75f5a3186e0e18d2b64fbe8478b47dd293512ef5ba8382bacc","observation_id":"0355dff0-b433-45e2-b30c-5f4e984bf3d3","resolution":{"observed_at":"2026-08-06T18:46:52.591981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:52.566411Z","title":"Horn and Charles R","venue":null,"work_id":"833e351b-f208-414b-863f-5fb7fe185981","year":1985},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.604072Z"},"links":{"citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:68f681401840e0cb238dbf36794e23bb0108f50f55201a2db253e2b475bce9b1","observation_id":"b8a3de07-4c47-4814-b2ab-2b3a239b7726","resolution":{"observed_at":"2026-08-06T18:46:52.571777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:52.544537Z","title":"Specformer: Guarding vision transformer robustness via maximum singular value penalization","venue":null,"work_id":"88315e81-f1c8-4615-a7c8-dfc164f07f90","year":2024},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.610816Z"},"links":{"citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:92cc5b6f268ca7b9fa5e3fc55f56b71ef0c0899fd634fd7a55302942e37decbe","observation_id":"8ad78ada-128d-4585-9df2-121cff3fa90c","resolution":{"observed_at":"2026-08-06T18:46:52.551786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-08-12T23:30:11.201041Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-06T18:46:51.617612Z","title":"MInference 1.0: Accelerating pre-filling for long-context llms via dynamic sparse attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.617612Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:fb8d4c4e9f15fb9b9c3e01629001a5826355f25d895fcc04498fcae651368d21","observation_id":"23b745b4-46bb-49aa-9d1a-daeb32a4bd09","resolution":{"observed_at":"2026-08-06T18:46:51.617612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:52.522049Z","title":"The lipschitz constant of self-attention","venue":null,"work_id":"fa610751-c996-4678-bcc7-d5ccc6d89e71","year":2021},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.624589Z"},"links":{"citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:b07cf2aa7a4d993df0dbbc540058e12f48ee172311a38ebe786df8327cf19096","observation_id":"e0e34c15-83c5-4344-b393-7e4ce1e1f554","resolution":{"observed_at":"2026-08-06T18:46:52.528380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:52.500646Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":"7a9f97e0-2a7b-4b05-9898-6cc1ebe02671","year":2023},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.631883Z"},"links":{"citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:f2bca88383aac63e46728333b92cb1e4e54e34c638a822bd8613b5e70759fcd7","observation_id":"f3567613-5416-4719-97eb-1010d25c25da","resolution":{"observed_at":"2026-08-06T18:46:52.507721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:52.478337Z","title":"On controllable sparse alternatives to softmax","venue":null,"work_id":"b7dcb970-3550-4ef0-84f8-0cad992544c0","year":2018},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.638537Z"},"links":{"citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:eca22f73b5d7e8937e543a98d6be196f1a9060235b0bfdb40070b9199762b970","observation_id":"1c9e34e0-b300-430b-8da3-d647d635aa37","resolution":{"observed_at":"2026-08-06T18:46:52.484663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-06T18:46:51.646057Z","title":"SGDR: Stochastic gradient descent with warm restarts","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.646057Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:3556e0e59be8f340b721d344de8aff2c8878482be55bd06aa9c5cbc843a88bae","observation_id":"ece4ca1d-7c25-426c-a4c2-237df4ca70a9","resolution":{"observed_at":"2026-08-06T18:46:51.646057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07016","last_updated":"2023-04-21T17:08:27Z","snapshot_observed_at":"2026-08-14T02:09:47.867690Z","submitted_at":"2022-12-14T04:08:56Z","title":"Understanding Zero-Shot Adversarial Robustness for Large-Scale Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07016","snapshot_observed_at":"2026-08-06T18:46:51.653891Z","title":"Understanding zero-shot adversarial robustness for large-scale models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.653891Z"},"links":{"cited_paper":"/paper/2212.07016","citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:d7dfc91f4e82e5e81a3bc81ca7e247c514f508b33f5539daaf1c5e876a72b10d","observation_id":"50dc4c1a-729e-4e73-b56c-9e13a115b502","resolution":{"observed_at":"2026-08-06T18:46:51.653891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09856","last_updated":"2023-04-19T17:59:39Z","snapshot_observed_at":"2026-08-13T11:59:14.507059Z","submitted_at":"2023-04-19T17:59:39Z","title":"LipsFormer: Introducing Lipschitz Continuity to Vision Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09856","snapshot_observed_at":"2026-08-06T18:46:51.661357Z","title":"Lipsformer: Introducing lipschitz continuity to vision transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.661357Z"},"links":{"cited_paper":"/paper/2304.09856","citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:d9d9d69732be5df0af040bff4549fbaa8d6d6027469205401400825af8543c47","observation_id":"90243db6-6bbe-4f33-be03-32701d509418","resolution":{"observed_at":"2026-08-06T18:46:51.661357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:51.669016Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.669016Z"},"links":{"citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:ef833d8468deb04df3c459f2bb4d466baf0aa5ebc0d95727c40a807a837a3bfa","observation_id":"dd05e904-0c7d-441b-b645-5938aa02ec35","resolution":{"observed_at":"2026-08-06T18:46:51.669016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08625","last_updated":"2022-02-17T12:20:52Z","snapshot_observed_at":"2026-07-31T09:00:36.259346Z","submitted_at":"2022-02-17T12:20:52Z","title":"Revisiting Over-smoothing in BERT from the Perspective of Graph","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08625","snapshot_observed_at":"2026-08-06T18:46:51.676269Z","title":"Revisiting over-smoothing in bert from the perspective of graph","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.676269Z"},"links":{"cited_paper":"/paper/2202.08625","citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:4cfcf457dfc7f1086e964adc8a09820d0f6c198d8e7f01ae03b34edd713b10f8","observation_id":"249f3fa9-c047-4022-ba70-e42969c807a8","resolution":{"observed_at":"2026-08-06T18:46:51.676269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:52.438028Z","title":"Springer Science & Business Media, 1997","venue":null,"work_id":"007bfc93-505a-493b-9119-049fce6aab88","year":1997},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.683813Z"},"links":{"citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:868203d91826d8b3238fb2284a5ead663f62279913a4f66785571690ab796a68","observation_id":"76611c81-9483-45bf-96fa-36aad1e8a803","resolution":{"observed_at":"2026-08-06T18:46:52.444528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:51.689831Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.689831Z"},"links":{"citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:a522377bbf63926cccdd6164b61e44a153f50adb312d3cc59299559fa82b5257","observation_id":"93e4be0d-7723-4ca8-8b3c-5d254ff02481","resolution":{"observed_at":"2026-08-06T18:46:51.689831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14950","last_updated":"2023-10-14T05:03:53Z","snapshot_observed_at":"2026-08-13T11:34:40.005414Z","submitted_at":"2023-05-24T09:40:56Z","title":"Adversarial Demonstration Attacks on Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14950","snapshot_observed_at":"2026-08-06T18:46:51.696831Z","title":"Adversarial demonstration attacks on large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.696831Z"},"links":{"cited_paper":"/paper/2305.14950","citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:27c18fe1765418775fd5c5282bec4e8eba5a21dc8c23814a66894d45816d0ecd","observation_id":"833b3936-1613-470b-8e76-90830b7e6893","resolution":{"observed_at":"2026-08-06T18:46:51.696831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18781","last_updated":"2024-11-01T01:45:27Z","snapshot_observed_at":"2026-08-12T23:55:30.984937Z","submitted_at":"2024-05-29T05:41:28Z","title":"On the Role of Attention Masks and LayerNorm in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18781","snapshot_observed_at":"2026-08-06T18:46:51.705543Z","title":"On the role of attention masks and layernorm in transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.705543Z"},"links":{"cited_paper":"/paper/2405.18781","citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:43f4c406294f69df7b34332ae54a385011de8aa81a2d0e17a52c0910360482eb","observation_id":"8f5904bf-327c-4300-8307-c04fb8544ce4","resolution":{"observed_at":"2026-08-06T18:46:51.705543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-08-14T06:01:54.549199Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-06T18:46:51.711799Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.711799Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:c84f467b78768df5fe301e63f4868d6cd7fb73c8f20ac9f98556a5ecbd1b9a91","observation_id":"c586bff1-31be-4d80-a846-8c5ff3c94304","resolution":{"observed_at":"2026-08-06T18:46:51.711799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06060","last_updated":"2024-06-10T07:14:56Z","snapshot_observed_at":"2026-08-12T23:46:42.632704Z","submitted_at":"2024-06-10T07:14:56Z","title":"Learning Physical Simulation with Message Passing Transformer","version":1},"cited_work":{"arxiv_id":"2406.06060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06060","snapshot_observed_at":"2026-08-06T18:46:51.880087Z","title":"Learning Physical Simulation with Message Passing Transformer","venue":"cs.LG","work_id":"1ef6f7ac-96ec-437b-9fe4-ae615a3c924f","year":2024},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.721304Z"},"links":{"cited_paper":"/paper/2406.06060","citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:b34d0c66c70a9a93e423d028468274ae76fcdd84d5c392e2ccffa08166822205","observation_id":"1cc3a302-17b0-48ef-b3d2-678399327dbe","resolution":{"observed_at":"2026-08-06T18:46:51.890098Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05258","last_updated":"2025-04-07T12:04:28Z","snapshot_observed_at":"2026-08-14T14:31:09.403736Z","submitted_at":"2024-10-07T17:57:38Z","title":"Differential Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05258","snapshot_observed_at":"2026-08-06T18:46:51.742088Z","title":"Differential transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.742088Z"},"links":{"cited_paper":"/paper/2410.05258","citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:9a4d637a12a62aba2e3fa201f45075ebf22c5eb6067d2cfbab06a6874929ac98","observation_id":"846e949f-a265-4aaf-9834-d21fe8097a49","resolution":{"observed_at":"2026-08-06T18:46:51.742088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:52.405999Z","title":"CutMix: Regularization strategy to train strong classifiers with localizable features","venue":null,"work_id":"f5c36994-4f33-43d6-a968-10616dd53ee6","year":2019},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.750621Z"},"links":{"citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:7f229cc339e1408813dd2251189d68212ad8bd3faee2fa38c14e602b54410b2e","observation_id":"b92fdbad-857d-460c-94ec-5f69ee86a973","resolution":{"observed_at":"2026-08-06T18:46:52.412232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.09412","last_updated":"2018-04-27T21:39:25Z","snapshot_observed_at":"2026-08-08T10:28:19.597631Z","submitted_at":"2017-10-25T18:30:49Z","title":"mixup: Beyond Empirical Risk Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.09412","snapshot_observed_at":"2026-08-06T18:46:51.757430Z","title":"mixup: Beyond empirical risk minimization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.757430Z"},"links":{"cited_paper":"/paper/1710.09412","citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:5954f35999823fd6dff4959a698bd31783f8fc8d57d1aef5da3f58922d42fcff","observation_id":"f6b0cb8a-7d48-420d-bcdc-201a7b09c4a6","resolution":{"observed_at":"2026-08-06T18:46:51.757430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:52.384153Z","title":"Exact” are averaged across the CIFAR-100 validation set. “Exact","venue":null,"work_id":"020f8e32-2c71-40e6-81f7-81042e6ffd7d","year":2022},"citing_paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:51.764217Z"},"links":{"citing_paper":"/paper/2507.07814"},"observation_digest":"sha256:4ee8b9578974e0847c1db388db909ccc76a7ba700f9a7c4cb8d72040ece01393","observation_id":"064b6b5e-5cf2-4c0f-be14-d2eedf4177cd","resolution":{"observed_at":"2026-08-06T18:46:52.391208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.07814","last_updated":"2025-07-10T14:45:31Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T21:49:02.223547Z","submitted_at":"2025-07-10T14:45:31Z","title":"Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":2,"verified_fuzzy":12},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 4 inbound Pith citation observations for arXiv:2507.07814."}