{"as_of":"2026-08-13T07:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1f9a0e92dfc3333e04f83983ad57383ca9a39f106bd61051de2f26528caacaa0","coverage":[{"denominator":199,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T16:17:09.834609Z","state":"measured"},{"denominator":104,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":104,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T19:08:23.052621Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-20T19:08:54.035553Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"cited_work":{"arxiv_id":"2604.10098","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.10098","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","venue":"cs.LG","work_id":"13fd00a7-48b0-40e3-82a7-8502aef0377c","year":2026},"citing_paper":{"arxiv_id":"2605.08234","last_updated":"2026-05-07T00:36:59Z","snapshot_observed_at":"2026-08-11T18:33:43.862136Z","submitted_at":"2026-05-07T00:36:59Z","title":"When Does Value-Aware KV Eviction Help? A Fixed-Contract Diagnostic for Non-Monotone Cache Compression","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T01:46:59.423533Z"},"links":{"cited_paper":"/paper/2604.10098","citing_paper":"/paper/2605.08234"},"observation_digest":"sha256:f8d58448b8f91afe0a079457d9694e84223580d6ab2115fd43807b1e45dc5325","observation_id":"4fdc6361-eb0e-4b00-a440-7d96b8680378","resolution":{"observed_at":"2026-05-12T07:51:42.864258Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"cited_work":{"arxiv_id":"2604.10098","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.10098","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","venue":"cs.LG","work_id":"13fd00a7-48b0-40e3-82a7-8502aef0377c","year":2026},"citing_paper":{"arxiv_id":"2605.08301","last_updated":"2026-05-08T11:43:51Z","snapshot_observed_at":"2026-08-12T13:51:17.409580Z","submitted_at":"2026-05-08T11:43:51Z","title":"Priming: Hybrid State Space Models From Pre-trained Transformers","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-12T01:14:01.584159Z"},"links":{"cited_paper":"/paper/2604.10098","citing_paper":"/paper/2605.08301"},"observation_digest":"sha256:b1009aff33bd0e8b2ed6f26e98fe2c778f689eb6c1a10ebe339cb2e070218d5b","observation_id":"8922d645-bb58-49af-94e9-c1af7a027842","resolution":{"observed_at":"2026-05-12T08:21:24.357221Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"cited_work":{"arxiv_id":"2604.10098","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.10098","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","venue":"cs.LG","work_id":"13fd00a7-48b0-40e3-82a7-8502aef0377c","year":2026},"citing_paper":{"arxiv_id":"2605.16147","last_updated":"2026-07-06T18:29:27Z","snapshot_observed_at":"2026-08-03T00:35:38.299188Z","submitted_at":"2026-05-15T16:27:10Z","title":"Registers Matter for Pixel-Space Diffusion Transformers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T19:08:23.052621Z"},"links":{"cited_paper":"/paper/2604.10098","citing_paper":"/paper/2605.16147"},"observation_digest":"sha256:19bba6d006179cf818ee8cc3d6e5d51ac6c34b871896cb902c5187044126c4b5","observation_id":"4f600ed0-32bd-4188-b9ed-d20e479b24bd","resolution":{"observed_at":"2026-05-20T19:08:54.036916Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"cited_work":{"arxiv_id":"2604.10098","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.10098","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","venue":"cs.LG","work_id":"13fd00a7-48b0-40e3-82a7-8502aef0377c","year":2026},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2604.10098","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:e5a6deebbc12a799cfb22c9d8d8ba91477b219a625817dfd1a4c3d27efec8827","observation_id":"4c0a1a53-3f16-4983-80fb-9df02a31f889","resolution":{"observed_at":"2026-05-20T07:58:07.543129Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.10098/citation-record","integrity":"/paper/2604.10098/integrity","json":"/paper/2604.10098/citation-record.json","paper":"/paper/2604.10098"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attentionisallyouneed","venue":null,"work_id":"beca494e-a013-4717-ab89-0b90f895e3b2","year":2017},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:445ed9619461797109c896383c1ac3863c6dd87d9b06314b81b8bc45dd790679","observation_id":"aa24d1ed-4df9-4616-87d0-923a5702cda2","resolution":{"observed_at":"2026-05-17T16:04:57.177831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey of transformers.AI open, 3:111–132","venue":null,"work_id":"82d296ad-48bf-4767-a24d-b0d3ae757858","year":2022},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:294fa7c7bc1c8c32f06e604ef8b5d8f0882bf91d9b828a87df8bd992ed8eed01","observation_id":"ee950246-922b-4ce5-b1d6-72867d807dbf","resolution":{"observed_at":"2026-05-17T16:04:57.174727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":"2303.18223","doi":"10.18653/v1/d16-1080","metadata_source":"pith","pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey of Large Language Models","venue":"cs.CL","work_id":"de1b42b5-4a0a-4b1f-8c78-1f7fe21be6c9","year":2023},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:605d5c79b2947a780effa7dbdd3fe802b96316eb08ac3b9792e05758cb37b7f7","observation_id":"cac07e63-6615-443a-843c-fcecb91c42ea","resolution":{"observed_at":"2026-05-11T09:05:57.971328Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on vision transformer.IEEE transactions on pattern analysis and machine intelligence, 45(1):87–110","venue":null,"work_id":"7d0adfd2-8cce-4577-9599-3f0424e9a39c","year":2022},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:fbead75c1cf085f14192d19f389e5d70ef21f5c0180e868274ff680561e75578","observation_id":"e55857f5-80ff-4e3d-b1c2-7de3f66bbb0d","resolution":{"observed_at":"2026-05-17T16:04:57.376498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T09:34:48.435051Z","title":"A survey on multimodal large language models.National Science Review, 11(12):nwae403","venue":null,"work_id":"811a7fd9-1a17-4b79-aa76-eae69f657966","year":2024},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:b455df93740369ecf92c927dea12ef16ea49bd498652a716ef672def9c9eb7b1","observation_id":"c6df39ab-eede-4575-9d58-4364ab95c7f9","resolution":{"observed_at":"2026-05-17T16:04:57.233501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey of embodied ai: From simulators to research tasks.IEEE Transactions on Emerging Topics in Computational Intelligence, 6(2):230–244","venue":null,"work_id":"59995b99-3f01-4a18-8ee8-5606381c4f83","year":2022},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:616d77bbf7b39a9a09b1440db279c098a99e561cb357e490b0ea2ee951c9429d","observation_id":"cbfe3669-25c5-4ee4-8745-06a0566685d1","resolution":{"observed_at":"2026-05-17T16:04:57.195014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.01322","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T09:37:49.308056Z","title":"Longcat-flash technical report","venue":null,"work_id":"112bbed5-cf36-4773-82b3-0229bfea4626","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:3b99778c36e4d1114bb23bb3b3c245cd90ed667973d636fff9eac659ca1e29dc","observation_id":"b88c1003-3aee-431e-9f69-9ec7cf38f5ed","resolution":{"observed_at":"2026-05-11T09:05:58.303917Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.00279","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T11:59:50.609970Z","title":"Longcat-flash-omni technical report","venue":null,"work_id":"1dbab870-b4d6-467a-8178-d537289d5aa4","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:3b50c05ed3181d79ebcfce638479ffbae2dba8bd2218413463afd4c924bc4a4f","observation_id":"4d2bcc5e-c999-409d-a858-248bc09478c9","resolution":{"observed_at":"2026-05-11T09:05:58.048016Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.18883","doi":"10.48550/arxiv.2509.18883","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Introducing LongCat-flash-thinking: A technical report","venue":"arXiv (Cornell University)","work_id":"d83b56e1-68ce-4e32-b9c0-fc080b79c8fd","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:ed42cc30a678da89f9dca68ddf7599449123f5c650fceb6ab8152519fa49599d","observation_id":"e76e36bd-6df1-439d-b30f-ab8df2a5736b","resolution":{"observed_at":"2026-05-11T09:05:58.275862Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.16725","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:50:10.434955Z","title":"Longcat-flash-thinking-2601 technical report","venue":null,"work_id":"1375347d-bbc3-47bf-a423-d4e39ac50144","year":2026},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:f65ffc09358663adcec5be3a6bf84ee06b20750486a7d9193616ea3dce909b3d","observation_id":"4020cc53-582e-4bc0-bb4a-2caf4c0fa977","resolution":{"observed_at":"2026-05-11T09:05:58.153487Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/cvpr52734.2025.00499","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vggt: Visual geometry grounded transformer","venue":"2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","work_id":"07a3c51b-ffe4-44d2-9239-86e84934db95","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:973c91406d79611e1898cf4c3f00ef8a47b83d0276e81e6406272692ccbf5c81","observation_id":"dcf4fd8c-f2b9-4198-bd7b-0bf4200a0326","resolution":{"observed_at":"2026-05-17T16:04:57.167958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-20T18:21:56.85888+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-20T18:21:56.85888+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.01204","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T16:17:09.634850Z","title":"Xstreamvggt: Extremely memory-efficient streaming vision geometry grounded transformer with kv cache compression","venue":null,"work_id":"b1bd4d0a-c9a5-4cb3-9657-76c34082baa8","year":2026},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:f7c072e77d00d8ebddb1c098aebc66203e63226de65715c267cf26862278f8d4","observation_id":"d8e7aaf8-2c98-42fe-9b6b-924dbb82e4e3","resolution":{"observed_at":"2026-05-11T09:05:58.055150Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.13414","last_updated":"2026-01-23T18:59:33Z","snapshot_observed_at":"2026-08-13T01:17:31.486420Z","submitted_at":"2025-09-16T18:00:14Z","title":"MapAnything: Universal Feed-Forward Metric 3D Reconstruction","version":3},"cited_work":{"arxiv_id":"2509.13414","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.13414","snapshot_observed_at":"2026-07-09T18:46:26.573653Z","title":"MapAnything: Universal Feed-Forward Metric 3D Reconstruction","venue":"cs.CV","work_id":"cb742a0f-0648-4cb0-904b-180184987f6b","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"cited_paper":"/paper/2509.13414","citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:be69fd8eeaf780be621711f0ca737ea1c017774b76763d15845c82c71fa105f1","observation_id":"32819257-1579-4fa8-89d7-f924e2c465ef","resolution":{"observed_at":"2026-05-12T11:06:15.374425Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on model compression for large language models.Transactions of the Association for Computational Linguistics, 12:1556–1577","venue":null,"work_id":"45f64c6c-dafb-49da-80c4-1ccdb02ec9fb","year":2024},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:53b14d4f39424dddd37f3b4b968c3eb0eb2a3a0bcfb33a3ceafaa90b230df3e1","observation_id":"32f393c0-5e39-4dad-b06e-12f81a13b2eb","resolution":{"observed_at":"2026-05-17T16:04:57.181587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient large language models: A survey.Transactions on Machine Learning Research","venue":null,"work_id":"01023d06-e54f-4991-8341-e2ce0dc450c6","year":2024},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:55f17ec76e712fd698f7aa46d3abeb0b5115e21b91a8452e3d03a4c5a8990f79","observation_id":"168935be-15c8-480e-bfcb-529ffdd705f6","resolution":{"observed_at":"2026-05-17T16:04:57.191707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quantization","venue":null,"work_id":"9296be76-d0e2-4b2e-82e0-987ca1a30d3d","year":2024},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:fa4f906f77b5a3ca3ba7bdb66bb5f2bb329f775c2ac1519041c63bbe48343830","observation_id":"d84989f8-3c51-41bb-9b67-bf363b2c12e7","resolution":{"observed_at":"2026-05-17T16:04:57.478668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-08-11T17:12:54.016914Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"cited_work":{"arxiv_id":"2601.14004","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.14004","snapshot_observed_at":"2026-07-03T05:27:39.623381Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","venue":"cs.CL","work_id":"4dc137c8-5a45-4f05-af90-21a590fb3d7b","year":2026},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"cited_paper":"/paper/2601.14004","citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:c2b985173a0b5cf7883594f5a86128da91007316ab20da8edea694cc25406f7f","observation_id":"b8481f70-56b4-4759-a618-a19ecdabd51a","resolution":{"observed_at":"2026-05-11T09:05:58.188305Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient attention mechanisms for large language models: A survey.Visual Intelligence","venue":null,"work_id":"ea744408-0791-4791-acd3-8e8e8988189d","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:66185e41c2bbeb7a424348830d9a4d42e6f8fcac839411a072f56f81c5e022ae","observation_id":"aa58d049-a37f-4072-9b53-63927d93ef9c","resolution":{"observed_at":"2026-05-17T16:04:57.576481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09834","last_updated":"2025-08-13T14:13:46Z","snapshot_observed_at":"2026-08-08T08:45:25.504330Z","submitted_at":"2025-08-13T14:13:46Z","title":"Speed Always Wins: A Survey on Efficient Architectures for Large Language Models","version":1},"cited_work":{"arxiv_id":"2508.09834","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09834","snapshot_observed_at":"2026-06-30T08:44:28.037573Z","title":"Speed Always Wins: a survey on efficient architectures for large language models","venue":null,"work_id":"fd87decc-a230-45f1-a04f-3b4579027843","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"cited_paper":"/paper/2508.09834","citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:f9e2b903ea320c0351b643494bcbae0c5a601969a4152f743c631508300b7d39","observation_id":"e44bbf8d-916b-4222-9cb8-1119b1d06ad6","resolution":{"observed_at":"2026-05-11T09:05:58.088861Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gated delta networks: Improving mamba2 with delta rule","venue":null,"work_id":"f874c05f-3388-4934-a5f7-8292515995fa","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:ec98858a21c1cd3afb281326b6785c0774610139fe511e56885dbd7a0f5d85cf","observation_id":"f81ad7ad-7f82-475f-93e8-0f3a5f87a551","resolution":{"observed_at":"2026-05-17T16:04:57.360005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-08-07T19:30:34.681869Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:2c6168d907ad4caa19ebcbfbe3495ccfac5310937f5b7c701851f45e13ef588e","observation_id":"de6dd072-f4d6-4212-b67c-d5e29b8340ac","resolution":{"observed_at":"2026-05-13T23:49:11.451207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Titans: Learning to memorize at test time","venue":null,"work_id":"04b0e2c6-7090-4631-acff-f790aa77c67b","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:3be3b86edd17245ccc7186721c97ca0df72fe8964963ba49610bd7da943e6340","observation_id":"39064cea-29aa-4a0c-916c-d3c497d5bbcb","resolution":{"observed_at":"2026-05-17T16:04:57.335021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"cited_work":{"arxiv_id":"2602.10718","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.10718","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","venue":"cs.LG","work_id":"b3887252-bc82-4fbe-8753-6edb44a54df1","year":2026},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"cited_paper":"/paper/2602.10718","citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:9355cccfc71669ba548e12410deb93b27377a1c9e64a47707e17ef780f00533b","observation_id":"1f507c2f-d205-4357-bc1c-f7dd9b5705f1","resolution":{"observed_at":"2026-05-11T09:05:58.161185Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficientstreaminglanguage models with attention sinks","venue":null,"work_id":"043e4719-6a5a-4fde-9210-b69fdd423708","year":2024},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:b66613782c3b9b3288648a887f837667c6302bb925edbbaeec0115e18a07102d","observation_id":"393f78f2-11e0-41ad-bb1d-5b6641c983c1","resolution":{"observed_at":"2026-05-17T16:04:57.241116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"When attention sink emerges in language models: An empirical view","venue":null,"work_id":"9dccca9b-c8f9-434c-b68f-c82a24a78b2e","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:643c9d4941604a0b6c3c0160e2096a82dcfbd41ce60f7af77d54d1e5fe61cdb6","observation_id":"1efefa74-c70c-405c-ad0e-5de673143071","resolution":{"observed_at":"2026-05-17T16:04:57.257031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gated attention for large language models: Non-linearity, sparsity, and attention-sink-free","venue":null,"work_id":"13af3f78-12ce-4980-8f55-f32b5dbe3c8a","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:f7280f0c004d307971194554ba1da3444bd1b0bbae760345def8d2d243354dd3","observation_id":"6760d8d1-b4b8-4e22-83cd-d258739857b9","resolution":{"observed_at":"2026-05-17T16:04:57.252877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Why do llms attend to the first token? InSecond Conference on Language Modeling","venue":null,"work_id":"9544a5e6-2364-4655-8c42-87844f3542c4","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:aeb4f2cf698f6ab852d50b45f1b678bfc1f8d0d022475f9ed73c8ddea704255d","observation_id":"db85d0cf-59e9-4f09-946c-4e1f39b1bb09","resolution":{"observed_at":"2026-05-17T16:04:57.214422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kvsink: Understanding and enhancing the preservation of attention sinks in kv cache quantization for llms","venue":null,"work_id":"ef796988-d867-42c8-8043-64832cee2bb4","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:bee52633b507cc4fae120751537fce7ad877a2a3a46129e79e6f80464f43fb53","observation_id":"a5a07e3f-2cfc-4b2c-8199-fe04345f26d2","resolution":{"observed_at":"2026-05-17T16:04:57.299064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Quantizable transformers: Removing outliers by helping attention heads do nothing","venue":null,"work_id":"154f458c-13bd-456b-8e29-3997a6094f8d","year":2023},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:c0d5bd5618220091464f1e5765a769596f08b77a5461c8d620abb67401cab9e2","observation_id":"3df883b1-4497-4f1a-bca7-dfb63386f7d5","resolution":{"observed_at":"2026-05-17T16:04:57.396459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09456","last_updated":"2025-04-13T06:47:32Z","snapshot_observed_at":"2026-08-07T16:06:12.282689Z","submitted_at":"2025-04-13T06:47:32Z","title":"Don't Deceive Me: Mitigating Gaslighting through Attention Reallocation in LMMs","version":1},"cited_work":{"arxiv_id":"2504.09456","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.09456","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Don’t deceive me: Mitigating gaslight- ing through attention reallocation in lmms","venue":null,"work_id":"04b5c0f8-b4c6-457f-ae39-c6b0cf6ff5d9","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"cited_paper":"/paper/2504.09456","citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:f28b38928fd40939bc4bb9a6072205790ff120776aac511df240b4cd71734bfa","observation_id":"a50651e7-c8f5-4354-8398-d541d342ac69","resolution":{"observed_at":"2026-05-11T09:05:58.172892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention reallocation: Towards zero-cost and controllable hallucination mitigation of mllms.International Journal of Computer Vision, 134(1):22","venue":null,"work_id":"65359fd6-b645-4032-a2c4-e0cd66bc6424","year":2026},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:539591e7ed85abdad6ef9d21fc29c5d56c9258031213f65694b4f9b7bce9c06d","observation_id":"65866687-b36b-4dd0-8b12-8914262073ad","resolution":{"observed_at":"2026-05-17T16:04:57.443368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vasparse: Towards efficient visual hallucination mitigation via visual-aware token sparsification","venue":null,"work_id":"f148fa6a-c129-4dd8-966a-11b9cb54e686","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:fc0b421203496c575b927691c759d1255d157866a1d492455759c7d5233d4b45","observation_id":"bfd8a969-39f3-4a61-a07e-c33628358d1a","resolution":{"observed_at":"2026-05-17T16:04:57.568874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.17021","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Forget- ting to forget: Attention sink as a gateway for backdoor- ing llm unlearning.arXiv preprint arXiv:2510.17021","venue":null,"work_id":"bc545c6a-78e1-419c-b924-72b2df984947","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:26e66d69ffcf97a9d48d75e5d021cb467c13a7bf0462dce7accae722adc85dac","observation_id":"e2987534-74e4-409c-8891-857451b67892","resolution":{"observed_at":"2026-05-11T09:05:58.194894Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Interpreting the repeated token phenomenon in large language models","venue":null,"work_id":"b20d50dc-142c-41f1-ae67-4db51d27e9bc","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:10fb398ef7eee8778ca1c67eb6c9adb60a95697989f201345b7cdb16b84417a3","observation_id":"f6a1d808-9c04-4d7d-87d2-01eb8a530128","resolution":{"observed_at":"2026-05-17T16:04:57.338513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Leveraging registers in vision trans- formers for robust adaptation","venue":null,"work_id":"adaa0281-b253-4d5f-a13b-9aa0aedd011a","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:bf28c96532d7d2ecfd3b096b69ca777d80b30a1eaf63bd97a975fd84e22a156d","observation_id":"e045dc42-cd84-4e90-b98e-5196a0f5e5ec","resolution":{"observed_at":"2026-05-17T16:04:57.218447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.13602","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T13:36:59.465220Z","title":"Nosa: Native and offloadable sparse attention","venue":null,"work_id":"727de993-3628-49af-8df1-d90b5799d122","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:195e7ca0818f40a79d421b8824473c1a136d7d8b85e87a12113cb89c11110cda","observation_id":"f834c925-b530-43f9-9a58-04361dd44fce","resolution":{"observed_at":"2026-05-11T09:05:58.272183Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.07651","last_updated":"2026-08-07T21:07:45Z","snapshot_observed_at":"2026-08-13T07:09:45.496911Z","submitted_at":"2025-10-09T00:58:28Z","title":"OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference","version":4},"cited_work":{"arxiv_id":"2510.07651","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.07651","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OBCache: Optimal brain KV cache pruning for efficient long-context LLM inference","venue":null,"work_id":"76a3a3cf-1a68-4fa0-9ac8-293b25f59f3a","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"cited_paper":"/paper/2510.07651","citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:145a58df69621e67ba9e3971e7a79fd26a4b4ae842f9e0829c46f3b4024d5896","observation_id":"e446f852-d717-4982-bde7-a17c29e5d233","resolution":{"observed_at":"2026-06-01T02:02:20.220338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SALS: Sparse attention in latent space for KV cache compression","venue":null,"work_id":"065e413e-7483-43d7-bc24-dc160b9fe3cb","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:b461dbc13689ffb6863d6f107824b4846f0ed429f8453fa3ff4e711c50a629db","observation_id":"9f4a8eca-af8a-46d6-a13f-a952e0fd9773","resolution":{"observed_at":"2026-05-17T16:04:57.341908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.21623","last_updated":"2026-04-16T21:29:54Z","snapshot_observed_at":"2026-08-03T21:57:13.209890Z","submitted_at":"2025-09-25T21:42:27Z","title":"OjaKV: Context-Aware Online Low-Rank KV Cache Compression","version":2},"cited_work":{"arxiv_id":"2509.21623","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.21623","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OjaKV: Context-Aware Online Low-Rank KV Cache Compression","venue":"cs.CL","work_id":"b9df1f67-9777-4893-8b1d-a59af4ad32a4","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"cited_paper":"/paper/2509.21623","citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:c38b269ed9d5e222eb9da87d10f49159b7283bf8f094cc39432f9eaad444f14f","observation_id":"2137741a-cb04-4054-9a6c-7edd591f158b","resolution":{"observed_at":"2026-05-11T09:05:57.862495Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.22603","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T01:56:27.415931Z","title":"Mitigating attention sinks and massive activations in audio-visual speech recognition with llms","venue":null,"work_id":"36137c5c-fc67-4bf6-b040-cda7718174f5","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:97535b87628e476498442059737c1b139054d54319f9ec7b2f86ef781ede02eb","observation_id":"f93cbd5e-34d1-4dee-9543-fbd0992eb31e","resolution":{"observed_at":"2026-05-11T09:05:58.141700Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention sinks and compression valleys in llms are two sides of the same coin","venue":null,"work_id":"5577955e-a2dd-4f06-b2b4-7a29101b1382","year":2026},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:c1c15888f9d832802608334e4cb84812a85b780334779562434dcafd23f6e70a","observation_id":"771e016f-74eb-4e44-8c0f-fd8cd0748642","resolution":{"observed_at":"2026-05-17T16:04:57.486196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Outlier-safe pre-training for robust 4-bit quantization of large language models","venue":null,"work_id":"4a0caa32-6288-4356-806d-781ddda89dfd","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:afd8b9ad25a81a9d284b714d71b777734ca9e9369d541a944c1677b6eee696b0","observation_id":"98a8b51d-41ea-4fb7-972b-0e6d7e477954","resolution":{"observed_at":"2026-05-17T16:04:57.496430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unveiling super experts in mixture-of-experts large language models","venue":null,"work_id":"44aaa568-00df-4116-891f-0560503275b3","year":2026},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:f90e3a5bab39e7a7d910c4db929594aebed3b0d1a966046fedc2ebb441b56861","observation_id":"768890e9-e056-4db0-bb79-bcb2b7f7d8b9","resolution":{"observed_at":"2026-05-17T16:04:57.506535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.09017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Value-state gated attention for mitigating extreme-token phenomena in transformers","venue":null,"work_id":"8100477a-ece2-4340-a9c7-399ec45dc732","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:003bea1c0729c485519b63761f0229abcf1a1f919697a4baa555e2c6ff490a09","observation_id":"ef20d4e6-ce66-462f-ae9d-c9befa908093","resolution":{"observed_at":"2026-05-11T09:05:57.839886Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Research and latest advancements","venue":null,"work_id":"e0c8c341-e0f6-459e-baed-83c341dbe5a9","year":2026},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:1e8dafa9f2798b568cc0fbe79b7740ef6d38dd978033dec7588cd1c8603ef414","observation_id":"71fe4d71-65e8-45b8-a10f-4c853a3c44d1","resolution":{"observed_at":"2026-05-17T16:04:57.200975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What are you sinking? a geometric approach on attention sink","venue":null,"work_id":"c1691ae2-bcaf-4290-8230-a0b53a4df03e","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:dc085ce0b8a299deb6506257ed7d24b9cec644b81e80a118593dde91802f75a5","observation_id":"d68d2ff5-7e28-4169-a9ba-e57d6582fa6b","resolution":{"observed_at":"2026-05-17T16:04:57.554852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03668","last_updated":"2026-08-02T11:57:48Z","snapshot_observed_at":"2026-08-06T23:23:55.395999Z","submitted_at":"2025-08-05T17:30:34Z","title":"CTR-Sink: Attention Sink for Language Models in Click-Through Rate Prediction","version":4},"cited_work":{"arxiv_id":"2508.03668","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.03668","snapshot_observed_at":"2026-07-04T16:39:58.193966Z","title":"Ctr-sink: Attention sink for language models in click-through rate prediction","venue":"cs.CL","work_id":"a77df349-6970-448d-8b5d-bbcc9e86717e","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"cited_paper":"/paper/2508.03668","citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:f9fd2d779682f618a47e63a3cff56dde61c2edfb20bc90b42a65cf009b82e8e4","observation_id":"114ccecc-d602-430e-ac76-ba5dc9bf27a2","resolution":{"observed_at":"2026-06-03T02:05:41.714027Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Does roberta perform better than bert in continual learning: An attention sink perspective","venue":null,"work_id":"cef80f3d-9235-4f5a-9ef3-e32c7ad616bc","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:749e3defcf6b18318163091d175083128c9ee1fea1e5bc70d041ae5430222c6b","observation_id":"1bdedb93-1215-4d49-b290-1109a8048d31","resolution":{"observed_at":"2026-05-17T16:04:57.409523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Outlier dimensions that disrupttransformersaredrivenbyfrequency","venue":null,"work_id":"b745afc9-70c1-4c52-b25d-97a2ca570456","year":2022},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:188f88dcf1580901b8014fe2589fee29c6b3b651219fba44a9869b8a55ab1710","observation_id":"ea2d9ab0-7a6b-4407-a97e-11bea1f4a85a","resolution":{"observed_at":"2026-05-17T16:04:57.447264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding and overcoming the challenges of efficient transformer quantization","venue":null,"work_id":"7637972a-c36f-4713-a999-f31c90526bbb","year":2021},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:27a16eacd2a2cede98598bc73e993f440eef9ff7b2e32d0e6289c72c017e993d","observation_id":"2f179ad1-0e5e-4064-96d6-24c8ead91245","resolution":{"observed_at":"2026-05-17T16:04:57.380628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bert busters: Outlier dimensions that disrupt transformers","venue":null,"work_id":"7b727e0b-c40c-4591-8a34-6ec6188ba925","year":2021},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:6ab0ea06dbb0199e481e3edabfa2592e04825d1c9dc6bbfd18287d7d441c3e17","observation_id":"246e340d-2548-400b-8953-3ecb2b5c7c8c","resolution":{"observed_at":"2026-05-17T16:04:57.413020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Positional artefacts propagate through masked language model embeddings","venue":null,"work_id":"26c3a7be-b956-4e96-874e-673abf5b987c","year":2021},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:6ea1d30fe36efc82f94ade5451d2cf6ff3c82910530500cf4e239bec4afaa699","observation_id":"5a3fc787-8962-4e36-b383-f53c3f750ef3","resolution":{"observed_at":"2026-05-17T16:04:57.557840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What does bert look at? an analysis of bert’s attention","venue":null,"work_id":"ba49960c-509e-403a-978b-12759858d4a8","year":2019},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:1c5b3e275c7b89bfd23a518de48bf01f2395bd37cae9a2a3615e6eebc2119ced","observation_id":"cf02788f-8034-429b-b9f5-4aa2a28ca8d7","resolution":{"observed_at":"2026-05-17T16:04:57.403131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.02780","last_updated":"2026-01-08T05:52:17Z","snapshot_observed_at":"2026-08-13T04:00:20.980341Z","submitted_at":"2026-01-06T07:31:47Z","title":"MiMo-V2-Flash Technical Report","version":2},"cited_work":{"arxiv_id":"2601.02780","doi":"10.48550/arxiv.2601.02780","metadata_source":"pith","pith_arxiv_id":"2601.02780","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiMo-V2-Flash Technical Report","venue":"cs.CL","work_id":"1f3df90c-4bc3-49b1-ad9b-7f3b34e4ffba","year":2026},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"cited_paper":"/paper/2601.02780","citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:957a4a1ba9b3b2cbdd1a85a950886435961056eff012dd32df6df98ae7d46002","observation_id":"960f5649-5ff8-4d3e-8efa-a60693af1ec3","resolution":{"observed_at":"2026-05-12T11:33:32.947936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-10T17:38:12.703557+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T17:38:12.703557+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.00919","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention needs to focus: A unified perspective on attention allocation","venue":null,"work_id":"0025092e-54a4-4a0f-b3d4-a2fdec5927ca","year":2026},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:9e97a21d72c112fec949da726b62e4a4a174f0cff13d06b3c150c81ea354dbbd","observation_id":"2db3180d-4542-4554-bdf8-9c6aea642ede","resolution":{"observed_at":"2026-05-11T09:05:57.925228Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.22213","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the existence and behaviour of secondary attention sinks","venue":null,"work_id":"45487aba-de1d-4601-9962-2fbb9f2f75a1","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:0ad60d8b89f5affd748b06d0ce0c46fe45572e6b7ed6c6604ee5af6629eba96d","observation_id":"be95aad9-6650-4018-be11-c998d820fb7e","resolution":{"observed_at":"2026-05-11T09:05:57.834936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.10411","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:03:51.714721Z","title":"Sliding window attention adaptation","venue":null,"work_id":"010a2a9f-63a9-4350-9b19-c1c007910f60","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:a7ac76f2b50d53c2bae06727773b74b6833d68a4a106287173f422c9f981c606","observation_id":"1854e6bb-ec19-4971-b475-4d91bd360291","resolution":{"observed_at":"2026-05-11T09:05:57.899852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.09146","doi":"10.48550/arxiv.2511.09146","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dope: Denoising rotary position embedding","venue":"ArXiv.org","work_id":"f2c450f3-6d65-4abd-85f6-2288d55b379a","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:382801b7c41d30fa85486d3e08979cc81f554118581ece9f581f54ccdaf8d705","observation_id":"f3c2dcbf-fbba-4479-8225-4d5f44fb2955","resolution":{"observed_at":"2026-05-11T09:05:57.932730Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.23225","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tweo: Transformers without extreme outliers enables fp8 training and quantization for dummies","venue":null,"work_id":"a81bf3d3-8479-4122-a6e2-82440ee3f8ad","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:770717738d2950ddc3b74f6809a6774bbe5fbb3f60dd768c05133655f909192e","observation_id":"f37dca4a-b180-431c-8a22-8f35b8cf15ee","resolution":{"observed_at":"2026-05-11T09:05:57.888361Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.10276","doi":"10.48550/arxiv.2510.10276","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Lost in the middle: An emergent property from information retrieval demands in LLMs","venue":"ArXiv.org","work_id":"55be2a17-4c66-4a7e-a242-a7fc4c579c96","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:495aeea5af4120da28e80d2649c3192977065dd69e448c909b08a1cf9573348f","observation_id":"d31aa59b-3ce7-434b-a2db-31062d808ae7","resolution":{"observed_at":"2026-05-11T09:05:57.983080Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04800","last_updated":"2026-04-21T13:16:20Z","snapshot_observed_at":"2026-08-12T17:48:16.385812Z","submitted_at":"2025-10-06T13:30:07Z","title":"Hybrid Architectures for Language Models: Systematic Analysis and Design Insights","version":3},"cited_work":{"arxiv_id":"2510.04800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.04800","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hybrid Architectures for Language Models: Systematic Analysis and Design Insights","venue":"cs.CL","work_id":"dbe26216-99a0-4ca6-982a-2bdb8da9f505","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"cited_paper":"/paper/2510.04800","citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:f4480247dc1059b8cc96652712e6c45b147bd8b4d7336be0e0cf7204d1718b48","observation_id":"3f1037da-5a52-4862-bdac-73ab5e75d78f","resolution":{"observed_at":"2026-05-11T09:05:58.030354Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.10129","last_updated":"2026-05-21T08:20:19Z","snapshot_observed_at":"2026-07-06T22:32:22.953630Z","submitted_at":"2025-10-11T09:28:26Z","title":"CacheClip: Accelerating RAG with Effective KV Cache Reuse","version":2},"cited_work":{"arxiv_id":"2510.10129","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.10129","snapshot_observed_at":"2026-07-04T12:09:48.882195Z","title":"Cacheclip: Accelerating rag with effective kv cache reuse","venue":"cs.LG","work_id":"71858052-13aa-4ee3-b48c-59619ff3b618","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"cited_paper":"/paper/2510.10129","citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:43d4e7eb9ef0ab4ac217640a7335e8de5717ff3ee4423b49c950fdb7329b0e2e","observation_id":"50321c96-3347-433c-9926-0d01d8d28f19","resolution":{"observed_at":"2026-05-22T02:03:50.604177Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.07318","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T13:48:20.317821Z","title":"Artificial hippocampus networks for efficient long-context modeling","venue":null,"work_id":"10307f0a-77af-4aa8-9c34-7942556ac739","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:15fad0069b60e6ce4b72151b3f1bf2496ae03c99137b53be5db1bb8f230a66eb","observation_id":"25c2da19-77a3-45dc-b3c5-5851a371073f","resolution":{"observed_at":"2026-05-11T09:05:57.940007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"vattention: Verified sparse attention via sampling","venue":null,"work_id":"433f2ccf-1b9d-4824-990e-d765248dad70","year":2026},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:29b101fa07380ed634a308038c52e4b394a7d111eb496289500ba345c477a20e","observation_id":"207ef988-1d6f-4bac-86f3-3fd01dc26dba","resolution":{"observed_at":"2026-05-17T16:04:57.237214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"All for one: Llms solve mental math at the last token with information transferred from other tokens","venue":null,"work_id":"93b493dd-42f2-42df-8ce2-3e97ca5ab2ce","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:527f7bb887b590692ec6fbde82b442b35caac1b001578bdd10135697ae9922b4","observation_id":"54bf7f7a-fb52-4402-b64b-bc7c801bcdac","resolution":{"observed_at":"2026-05-17T16:04:57.269537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-01T16:27:35.664983Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":"2508.10925","doi":"10.3115/1073083.1073135","metadata_source":"pith","pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","venue":"cs.CL","work_id":"178c1f7e-4f19-4392-a45d-45a6dfa88ead","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:beb8dd55fa932043b1b286ff084689b79dab5cf3037c0c3d47123a7f7fbc04f2","observation_id":"03d321b5-84f7-41f9-898f-29e2f3a152f9","resolution":{"observed_at":"2026-05-11T09:05:58.295555Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-11T19:19:47.962081+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T19:19:47.962081+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Integral transformer: Denoising attention, not too much not too little","venue":null,"work_id":"022097cd-becc-4775-afa4-23615e824690","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:dbae6262d2079caee6dc7a4ee4759438baf457dd8f64bc3963259bd1767d2d7c","observation_id":"ff7cee7d-36e9-4391-b84a-5505e1d91cb2","resolution":{"observed_at":"2026-05-17T16:04:57.302360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"H2eal: Hybrid-bonding architecture with hybrid sparse attention for efficient long-context llm inference","venue":null,"work_id":"5425601c-d432-44a9-95a1-1b75c022cacf","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:90e886634ff524f3f820f3d7e245a266f54be90c9691299d8ae1653628807ab8","observation_id":"336dfe7d-52d5-45d8-bbdb-ef3468de23b6","resolution":{"observed_at":"2026-05-17T16:04:57.164002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21526","last_updated":"2026-04-21T03:10:04Z","snapshot_observed_at":"2026-08-11T08:25:03.584847Z","submitted_at":"2025-07-29T06:28:23Z","title":"Accelerating Prefilling via Decoding-time Contribution Sparsity","version":4},"cited_work":{"arxiv_id":"2507.21526","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21526","snapshot_observed_at":"2026-06-30T06:14:19.020219Z","title":"Accelerating Prefilling via Decoding-time Contribution Sparsity","venue":"cs.CL","work_id":"e2d52e1f-056c-415e-af4a-8b3dfe4d0817","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"cited_paper":"/paper/2507.21526","citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:b91a3f8460a4d0f4ff59a634c9e9b949a6767f970b556853e667ab742b417876","observation_id":"5a3aa25d-3f69-4882-8886-3b6d2f0c7957","resolution":{"observed_at":"2026-05-11T09:05:58.042049Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Orthorank: Token selection via sink token orthogonality for efficient llm inference","venue":null,"work_id":"b3b31c4f-1ba0-426c-9624-76754afc4c07","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:04a61a783f9d52d4944fd323bf972ec30c882508fd65ba9048ffb250276662a8","observation_id":"9ec1466d-6bf2-48ed-932c-5caa6f95b8d0","resolution":{"observed_at":"2026-05-17T16:04:57.320335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Earn: Efficient inference acceleration for llm-based generative recommendation by register tokens","venue":null,"work_id":"622382e5-5839-4351-916f-4dbd422c6a2e","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:ca00ad6f05e1d21037092346044c6adcae8911185f306ca98f7f878a44e213dc","observation_id":"e2bde12f-8c3e-4e22-9bb3-ff06e7bdbfcd","resolution":{"observed_at":"2026-05-17T16:04:57.349150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19608","last_updated":"2025-07-25T18:23:18Z","snapshot_observed_at":"2026-08-13T05:01:33.980987Z","submitted_at":"2025-07-25T18:23:18Z","title":"DeltaLLM: A Training-Free Framework Exploiting Temporal Sparsity for Efficient Edge LLM Inference","version":1},"cited_work":{"arxiv_id":"2507.19608","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.19608","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deltallm: A training-free framework exploiting temporal sparsity for efficient edge llm inference","venue":null,"work_id":"d906e8ec-ce84-4b12-a9db-3ed4daed8740","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"cited_paper":"/paper/2507.19608","citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:c3335653e7d9d94e959c1828aae90a069add8f1ccb913dc7da41bcac9dafec49","observation_id":"b9c372f8-f66e-4582-b2d8-0b483a5920f6","resolution":{"observed_at":"2026-05-11T09:05:57.881229Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"cited_work":{"arxiv_id":"2506.12220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12220","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Two heads are better than one: simulating large transformers with small ones","venue":null,"work_id":"20dd94c9-701c-42fe-ba76-8894c62c20e2","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"cited_paper":"/paper/2506.12220","citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:71833441d2d33927922adb341c7bf2d68c2f2a45926801da479059a58abd2696","observation_id":"795242bf-3d0f-49a8-96ad-9f827583f903","resolution":{"observed_at":"2026-05-11T09:05:58.232597Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-11T00:38:33.517153Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"cited_work":{"arxiv_id":"2506.15704","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15704","snapshot_observed_at":"2026-06-30T07:04:20.888331Z","title":"Learn from the past: Fast sparse indexing for large language model decoding","venue":null,"work_id":"6ab074c0-906d-42d7-80ee-a137f5533fec","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"cited_paper":"/paper/2506.15704","citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:2fd95fdb6eaad692cd08c7251182c8cc110e191f69adccd87a8ba08d6eb9c56a","observation_id":"adc68189-911a-4ea2-bb71-b3f964fbeaf9","resolution":{"observed_at":"2026-05-11T09:05:57.988048Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zerotuning: Unlocking the initial token’s power to enhance large language models without training","venue":null,"work_id":"6261d52b-2844-4c58-93ed-1d2286fea1d6","year":2026},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:ba3a8877c8a6b52c7bdaa12ba7afdaf710c4d4cb4b174750fbfe8b57b250d8c9","observation_id":"1cf09c47-39bd-4361-80bd-044d0ef29ddf","resolution":{"observed_at":"2026-05-17T16:04:57.561092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.11254","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Delta attention: Fast and accurate sparse attention inference by delta correction","venue":null,"work_id":"a93d6190-0c1a-4d9e-93da-3efae7301f1c","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:9c69e273a6fdbd225e4790b13cc60bb04971cade6b7cbb48a6500c4f6bd1c9dc","observation_id":"1095e0a4-1e1c-49cf-a782-17eca38f0219","resolution":{"observed_at":"2026-05-11T09:05:58.009864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20966","last_updated":"2026-04-17T09:56:07Z","snapshot_observed_at":"2026-07-06T21:16:36.894196Z","submitted_at":"2025-04-29T17:36:18Z","title":"Softpick: No Attention Sink, No Massive Activations with Rectified Softmax","version":4},"cited_work":{"arxiv_id":"2504.20966","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.20966","snapshot_observed_at":"2026-06-29T08:23:15.622080Z","title":"Softpick: No Attention Sink, No Massive Activations with Rectified Softmax","venue":"cs.LG","work_id":"94b1ae96-600a-44e3-9fb8-c3ac26d1ca0e","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"cited_paper":"/paper/2504.20966","citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:c85089120697762efd6be235e1ff955712ba92600cee1b12f0be46a805daf024","observation_id":"1639b654-9aab-48e4-bd4f-b3999b366418","resolution":{"observed_at":"2026-05-11T09:05:58.105206Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Keydiff: Key similarity-based kv cache eviction for long-context llm inference in resource-constrained environments","venue":null,"work_id":"8c78fd21-c4ea-4ab2-995a-5bf59b9bd9ce","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:e72d401fec15c9d4f73f5a42447c17c5d53eb49a9cb411e6c649728f2cdb1a50","observation_id":"3ee72983-7d7e-4f35-8819-1d5a02246a15","resolution":{"observed_at":"2026-05-17T16:04:57.591502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Edgeinfinite: A memory-efficient infinite-context transformer for edge devices","venue":null,"work_id":"e6a1745d-4594-456a-ac79-252e1252bcc4","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:7812584a9c77cc0ee5ac80ca5efa41adde30100e5e4d26a89e4781683bad72b1","observation_id":"b2b788cb-8714-4281-9d76-4ce1c7ff662d","resolution":{"observed_at":"2026-05-17T16:04:57.539087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient many-shot in-context learning with dynamic block-sparse attention","venue":null,"work_id":"fc57112f-4081-4465-a167-e619203692ae","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:921a771bf6d540cc161acf227b9ba0c0f34f03c3239a8106ab2fd303bc3fc49d","observation_id":"da0721a4-2131-4411-a749-dce0a4205400","resolution":{"observed_at":"2026-05-17T16:04:57.516167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the emergence of position bias in transformers","venue":null,"work_id":"b1fd2a70-d1d1-47cc-b4b4-4423f29c8a49","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:ef8651456a60027ddf994ba17008e4f3784158a0da0229f99e68feaac2fd11f4","observation_id":"84ca17e2-b00a-40d1-adc7-abaa8a0af1db","resolution":{"observed_at":"2026-05-17T16:04:57.529286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Systematic outliers in large language models","venue":null,"work_id":"8e4c5a66-2171-4eaa-b7e8-415c5d994d68","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:179368b1239f342fcfb93806aca1cdbf54d7e7eb3ca252af7296775bea32e8a3","observation_id":"7f68eefa-308c-4eee-8c79-407d050c2206","resolution":{"observed_at":"2026-05-17T16:04:57.541810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18845","last_updated":"2025-06-04T08:36:19Z","snapshot_observed_at":"2026-08-07T17:48:09.868777Z","submitted_at":"2025-02-26T05:31:44Z","title":"Sliding Window Attention Training for Efficient Large Language Models","version":2},"cited_work":{"arxiv_id":"2502.18845","doi":"10.48550/arxiv.2502.18845","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18845","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sliding window attention training for efficient large language models","venue":"ArXiv.org","work_id":"bfaf1468-70be-4e01-9473-42ce5e715f51","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"cited_paper":"/paper/2502.18845","citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:be0562954452269a857fa3a8517085b12f3afb34b73c1a8ef8ac2a2a283890d5","observation_id":"504b86fc-5c12-47e3-a090-8a0a6792d74f","resolution":{"observed_at":"2026-05-11T09:05:57.944778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rotatekv: Accurate and robust 2-bit kv cache quantization for llms via outlier-aware adaptive rotations","venue":null,"work_id":"1a60f3bf-75ad-4155-855f-97fef744d240","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:55c53b4419d19849510f1aea4313f28a375b0a51d39fa5b7345ed7e3a5f8e134","observation_id":"7897ecfb-2b3e-4b52-bc2a-5b13b7ea0df4","resolution":{"observed_at":"2026-05-17T16:04:57.588022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Weight-based analysis of detokenization in language models: Understanding the first stage of inference without inference","venue":null,"work_id":"b0eede33-061c-466a-add6-7ccd3077582c","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:6388e49546b882250984e9ee88604f3a92caddea1ce12eb2efc95f3501cb5d3b","observation_id":"fb8c00e9-eaeb-46e1-915f-b24ca2ef0ae7","resolution":{"observed_at":"2026-05-17T16:04:57.583256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-13T02:14:20.194697Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"cited_work":{"arxiv_id":"2501.15113","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.15113","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Task-kv: Task-aware kv cache optimization via semantic differentiation of attention heads","venue":null,"work_id":"f8b543ba-91b3-46f2-b6fb-a018108940cf","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"cited_paper":"/paper/2501.15113","citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:86104ad62b99eee5e381480e7239a00ea513758bd8377c03335be459af62577f","observation_id":"84eace44-4527-4779-9b34-87224001a7b8","resolution":{"observed_at":"2026-05-11T09:05:58.130976Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08879","last_updated":"2025-03-11T20:45:02Z","snapshot_observed_at":"2026-08-11T02:55:45.516067Z","submitted_at":"2025-03-11T20:45:02Z","title":"LLMs Know What to Drop: Self-Attention Guided KV Cache Eviction for Efficient Long-Context Inference","version":1},"cited_work":{"arxiv_id":"2503.08879","doi":"10.48550/arxiv.2503.08879","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.08879","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wei, J., Wang, X., Schuurmans, D., Bosma, M., Ichter, B., Xia, F., Chi, E., Le, Q., and Zhou, D","venue":"ArXiv.org","work_id":"e12f679e-9f5f-4fd4-9160-306a9bb2d556","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"cited_paper":"/paper/2503.08879","citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:2120bc3b40800dd251b41b5ee288db1db7ae65a6e10a7e3353cb5d4af90f7b53","observation_id":"603475af-914f-474d-a411-ae9f945955aa","resolution":{"observed_at":"2026-05-11T09:05:58.252809Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-11T21:49:09.968526+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T21:49:09.968526+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unigist: Towards general and hardware-aligned sequence-level long context compression","venue":null,"work_id":"75b7ba91-1cce-46db-8696-1090ce93aa14","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:234dc8de40bdf11316482f67331dc4a6d73f7d1d88806a3fa5565e3228515c08","observation_id":"91ddf077-214f-423d-ad7b-374bb4a8388d","resolution":{"observed_at":"2026-05-17T16:04:57.489633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cache me if you must: Adaptive key-value quantization for large language models","venue":null,"work_id":"0a53b3a7-b5ad-49a1-a586-5588a64b4cc2","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:a28b6faa2de198866dc53f61d77e003bef117296931937306332ed1eddb3569a","observation_id":"27c70ef9-2217-497b-ad11-3b63e1763b40","resolution":{"observed_at":"2026-05-17T16:04:57.532382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Position bias mitigates position bias: Mitigate position bias through inter-position knowledge distillation","venue":null,"work_id":"b8e57382-d49e-4c11-8894-3ecb855a99fb","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:9bce68d5b76fa2b653deae1510c7e4ad1d9606a1ebcb61dc462b321d0f4de514","observation_id":"89d228a3-631e-47a7-842f-9e04d8bc6c14","resolution":{"observed_at":"2026-05-17T16:04:57.466482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention sinks: A’catch, tag, release’mechanism for embeddings","venue":null,"work_id":"a9b05277-f2d3-44ee-88e3-d46d61b3ab46","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:155902201840b72217497051f39db01028013a94ed0c108ca1f3e32594cf0c2b","observation_id":"3bbb1062-47a9-45c6-8b6c-5a19fd9ed013","resolution":{"observed_at":"2026-05-17T16:04:57.352899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The singular anchor: First token dominance in large language model attention sinks","venue":null,"work_id":"a839d14a-351e-4eab-8092-077d12b5c57b","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:8d1a0ed7c1bd4310cf73db09b0a481bd18e2f34efcc997909c90b95788c7bfc8","observation_id":"0ccd0280-dc05-4452-90db-33226c650173","resolution":{"observed_at":"2026-05-17T16:04:57.264328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention entropy is a key factor: An analysis of parallel context encoding with full-attention-based pre-trained language models","venue":null,"work_id":"68299199-60c8-410b-a206-d85cdde70a70","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:5f41222c564e14de1c214e904c764238e1e84d840f990644623e0e4dcf65f86e","observation_id":"16d92e27-cecf-43db-ac4e-ec692a42a7c8","resolution":{"observed_at":"2026-05-17T16:04:57.287632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sgd-kv: Summarization guided kv cache compression","venue":null,"work_id":"8f71665e-de10-4682-8547-d35377e7df75","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:44e78dce62a452b46d961c2155b590d997a414541e1f0454602a84b1e135f69d","observation_id":"91e055e8-98f2-4bc1-b6cf-dbd9e1794167","resolution":{"observed_at":"2026-05-17T16:04:57.597540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Initial-key cache: An efficient kv cache strategy focusing on initial and key tokens for llms","venue":null,"work_id":"e175da5e-69f9-427a-8e65-4a9ea9576f9d","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:14dc7316830be7c9c6a279100565bb617925c1d2708846cd5065fbce31961b4b","observation_id":"e16d1cbe-8c4b-4ce2-ae7b-270cd756d960","resolution":{"observed_at":"2026-05-17T16:04:57.482687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Entropy-guided kv caching for efficient llm inference.Mathematics, 13(15):2366","venue":null,"work_id":"dec490c7-98bf-4c6a-b180-6d4dbe19213d","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:c3fe6e21fdeb76065472e4dccadc2b262732df34a4f6a5b0962cce5acbc7a247","observation_id":"e660d061-3644-48d4-9a6c-d5993d303167","resolution":{"observed_at":"2026-05-17T16:04:57.434982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Subkv: Quantizing long context kv cache for sub-billion parameter language models on edge devices.Software: Practice and Experience","venue":null,"work_id":"02a01c29-78f7-4a21-9f67-0469d7728092","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:7ac24c189d370a6a2a24525b36a80df022201cb80fb2788e646e450aceecfaa3","observation_id":"c5a3008c-c18e-4efb-b018-f2ed58490db3","resolution":{"observed_at":"2026-05-17T16:04:57.535584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Massive activations in large language models","venue":null,"work_id":"9104144d-a3bf-4ef7-acdc-7ec421037aa2","year":2024},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:a806398e3bee6abe51ddd74d3da8ab3eb1f8a9f30a7bee19c4e1e380234c0ba8","observation_id":"4e853cd0-58bf-4c20-9f95-edc29fb87b1e","resolution":{"observed_at":"2026-05-17T16:04:57.503056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.12201","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Omnisparse: Training-aware fine-grained sparse attention for long-video mllms","venue":null,"work_id":"336eb89f-7985-4a33-8c6b-1ab815c63d89","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:c903d108979e19395238fd9319b6039da26bac9ce9cd211c9ac7055b2e44137e","observation_id":"f6c75b00-d2a4-49f4-995c-699f964361e9","resolution":{"observed_at":"2026-05-11T09:05:57.996556Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bitmar: Low-bit multimodal fusion with episodic memory for edge devices","venue":null,"work_id":"dc4e1346-4be6-4ad6-9345-142c109312b6","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:538ca29e7c698973969d55bcfa92ae252018be61a7c71e7f495f158c1f42b9d3","observation_id":"8268f3fa-58e1-4791-b138-81a3cabacf43","resolution":{"observed_at":"2026-05-17T16:04:57.331581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":39,"verified_fuzzy":60},"total_outbound_references":199},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 100 of 199 outbound references and 4 inbound Pith citation observations for arXiv:2604.10098."}