{"as_of":"2026-08-07T15:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b89a8b71cea0eb285e2bbfa700ecd6d4d20027d4035e1be83273177f997bf4d5","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T09:04:34.807225Z","state":"measured"},{"denominator":124,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":124,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":89,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":89,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:09:07.284810Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-07T12:09:07.284810Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00479","last_updated":"2025-05-31T09:10:43Z","snapshot_observed_at":"2026-08-07T12:02:00.195241Z","submitted_at":"2025-05-31T09:10:43Z","title":"EffiVLM-BENCH: A Comprehensive Benchmark for Evaluating Training-Free Acceleration in Large Vision-Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T12:09:07.284810Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2506.00479"},"observation_digest":"sha256:b9a48add57dd858d30a97f6556e8da34ead6921b358f755010eb76944afda43c","observation_id":"b29b7b36-0969-493b-b45d-fef4ece0c31a","resolution":{"observed_at":"2026-08-07T12:09:07.284810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2509.26645","last_updated":"2026-03-03T12:58:09Z","snapshot_observed_at":"2026-07-30T21:37:36.891851Z","submitted_at":"2025-09-30T17:59:51Z","title":"TTT3R: 3D Reconstruction as Test-Time Training","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-17T06:41:16.306593Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2509.26645"},"observation_digest":"sha256:22f795707c8e65bf6c413f0c5a56742db85868203380ab69f693e69410991b67","observation_id":"38b63a25-bb82-4f23-8143-0b191005e0bd","resolution":{"observed_at":"2026-05-17T06:41:16.440866Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:6df9bc9e9c499bb313a47ff5d659d600b5a3af4ac4e0834e5288de093dbb6387","observation_id":"bf83668c-6f1c-4e1e-b0be-bd887d7e2282","resolution":{"observed_at":"2026-05-18T10:02:31.643403Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2510.04800","last_updated":"2026-04-21T13:16:20Z","snapshot_observed_at":"2026-08-02T20:03:37.497118Z","submitted_at":"2025-10-06T13:30:07Z","title":"Hybrid Architectures for Language Models: Systematic Analysis and Design Insights","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-18T10:18:04.431436Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2510.04800"},"observation_digest":"sha256:d7bfd434def580bf903040724b4dc7b4cc448875bd2f48291df9a2b0b6b6de6d","observation_id":"ab33c231-c8c6-4188-ab12-2c8a418ee5e9","resolution":{"observed_at":"2026-05-18T10:21:14.965889Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:2a9d985b857b38d4669f5e269a7ecc63f77f82fb1f064043cc9dee48c7773a3a","observation_id":"afd76c00-2e1e-4de2-801c-17f45045ef73","resolution":{"observed_at":"2026-05-13T23:49:10.768666Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2512.12087","last_updated":"2026-04-28T06:58:25Z","snapshot_observed_at":"2026-07-06T22:38:54.914862Z","submitted_at":"2025-12-12T23:30:43Z","title":"BLASST: Dynamic BLocked Attention Sparsity via Softmax Thresholding","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T22:20:53.856657Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2512.12087"},"observation_digest":"sha256:8d8c475bbeeac8d3152e1dbec9af04c2c01d0f32f66d48e66d9c47d62c2b3700","observation_id":"4ddb7f6e-22a5-431d-84a9-3a008af0c8fb","resolution":{"observed_at":"2026-05-16T22:21:18.639195Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2601.02780","last_updated":"2026-01-08T05:52:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-06T07:31:47Z","title":"MiMo-V2-Flash Technical Report","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T11:33:32.568261Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2601.02780"},"observation_digest":"sha256:69ea5c04ea5e428fda93a07baa6b0d8b5f2bc2956d8802fa630f84412a6c9eb3","observation_id":"ae3f44f5-b7d3-4d9d-9280-1e0bdf357842","resolution":{"observed_at":"2026-05-12T11:33:32.874392Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-03T10:57:26.264016Z","title":"Queipo-de-Llano, E., Arroyo, A., Barbero, F., Dong, X., Bronstein, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.08131","last_updated":"2026-05-27T05:21:10Z","snapshot_observed_at":"2026-08-06T13:11:15.178599Z","submitted_at":"2026-01-13T01:52:19Z","title":"Attention Projection Mixing with Exogenous Anchors","version":4},"reference_index":708,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:26.264016Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2601.08131"},"observation_digest":"sha256:17ee649553d58bf91cbe27a78b67b03d962f8a14508dff697183af8b3e67abcc","observation_id":"cd6978a6-ed24-44cc-96e2-8d954dd1520d","resolution":{"observed_at":"2026-08-03T10:57:26.264016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-03T08:07:43.687328Z","title":"Gated attention for large language models: Non-linearity, sparsity, and attention-sink-free,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.18135","last_updated":"2026-01-26T04:35:31Z","snapshot_observed_at":"2026-08-03T08:07:42.296544Z","submitted_at":"2026-01-26T04:35:31Z","title":"Forward Consistency Learning with Gated Context Aggregation for Video Anomaly Detection","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T08:07:43.687328Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2601.18135"},"observation_digest":"sha256:d7cbd085e980d1718abf659e9c3137ceefa271bb4c9e91efa669dd1cde793e04","observation_id":"62f552bd-66e9-403d-af85-493a44296a90","resolution":{"observed_at":"2026-08-03T08:07:43.687328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2602.08064","last_updated":"2026-05-21T09:52:18Z","snapshot_observed_at":"2026-08-04T01:56:43.373244Z","submitted_at":"2026-02-08T17:17:56Z","title":"SiameseNorm: Breaking the Barrier to Reconciling Pre/Post-Norm","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T11:11:51.440058Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2602.08064"},"observation_digest":"sha256:5b19f6f78740a2d6bfd6f93739fbf5296f306286fa6e0e25730a8c86a86c5f1c","observation_id":"8273196e-a848-4431-a44d-563b51eb96b0","resolution":{"observed_at":"2026-05-22T11:14:47.997394Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2602.11146","last_updated":"2026-05-22T14:43:10Z","snapshot_observed_at":"2026-07-06T22:45:29.609382Z","submitted_at":"2026-02-11T18:57:29Z","title":"Beyond VLM-Based Rewards: Diffusion-Native Latent Reward Modeling","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-25T06:41:33.493927Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2602.11146"},"observation_digest":"sha256:68d108f912b22196668f9bc4333246947523281a9d9ba56331357025642f6aad","observation_id":"bc7e5712-081f-496e-ab5d-09fa68e655b8","resolution":{"observed_at":"2026-05-25T06:45:26.139781Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2602.22479","last_updated":"2026-04-17T17:13:27Z","snapshot_observed_at":"2026-07-06T22:47:06.893212Z","submitted_at":"2026-02-25T23:38:16Z","title":"Efficient Continual Learning in Language Models via Thalamically Routed Cortical Columns","version":6},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T19:08:25.217050Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2602.22479"},"observation_digest":"sha256:92ee82c6c719cf81c8865c156206e2db1f379b5d8346ac11a235587ed2731623","observation_id":"e40f0476-06c8-47ea-bbf9-b5e0abf10be6","resolution":{"observed_at":"2026-05-15T19:10:15.788667Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2603.02727","last_updated":"2026-05-01T01:28:02Z","snapshot_observed_at":"2026-07-06T22:47:37.679205Z","submitted_at":"2026-03-03T08:26:08Z","title":"Gated Differential Linear Attention: A Linear-Time Decoder for High-Fidelity Medical Segmentation","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T17:31:20.004673Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2603.02727"},"observation_digest":"sha256:1732246c354779cf4c06e6f994c422a3b2c58a6389418db3d876203d140f0b07","observation_id":"60ae144e-dee4-40bb-893b-94e07609f059","resolution":{"observed_at":"2026-05-15T17:31:22.094714Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-02T19:04:56.345504Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.03993","last_updated":"2026-06-04T09:24:00Z","snapshot_observed_at":"2026-08-04T23:26:46.694753Z","submitted_at":"2026-03-04T12:37:08Z","title":"Specialization of softmax attention heads: insights from the high-dimensional single-location model","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T19:04:56.345504Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2603.03993"},"observation_digest":"sha256:a17b14d7b4075005dd55ae9a97f2d14b551d6d8273f359134ad0d9b7da42ead5","observation_id":"f6d38f7a-5ce3-4bdc-aa5b-3f50d9f7c17b","resolution":{"observed_at":"2026-08-02T19:04:56.345504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2603.04385","last_updated":"2026-04-08T22:29:40Z","snapshot_observed_at":"2026-07-06T22:47:50.848191Z","submitted_at":"2026-03-04T18:49:37Z","title":"ZipMap: Linear-Time Stateful 3D Reconstruction via Test-Time Training","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-15T16:21:16.229770Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2603.04385"},"observation_digest":"sha256:26a185da3ddbe7c2032bfa9e469e9221ef320bf3ac771eb5dbc957e59b6aaa14","observation_id":"7197e69a-8652-42d0-b412-28e3be129138","resolution":{"observed_at":"2026-05-15T16:26:17.524856Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2603.05117","last_updated":"2026-07-30T06:55:05Z","snapshot_observed_at":"2026-08-02T23:16:32.480088Z","submitted_at":"2026-03-05T12:42:53Z","title":"SeedPolicy: Horizon Scaling via Self-Evolving Diffusion Policy for Robot Manipulation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T16:41:43.120491Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2603.05117"},"observation_digest":"sha256:e40f1702c70cae53508414742cb78a4a9f58689891c74c05d2b5f28b8b4fcb12","observation_id":"4e57a20e-424f-4706-9c6c-7195c75aeaa5","resolution":{"observed_at":"2026-05-15T16:46:18.404563Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-02T18:47:52.159297Z","title":"Gated attention for large language models: Non-linearity, sparsity, and attention-sink-free.arXiv preprint arXiv:2505.06708, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05117","last_updated":"2026-07-30T06:55:05Z","snapshot_observed_at":"2026-08-02T23:16:32.480088Z","submitted_at":"2026-03-05T12:42:53Z","title":"SeedPolicy: Horizon Scaling via Self-Evolving Diffusion Policy for Robot Manipulation","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T18:47:52.159297Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2603.05117"},"observation_digest":"sha256:6cdb4ab2c67ef5215c64d7250438532a7c774e8b341ffcf243a606976e357e21","observation_id":"af5ddb22-ff75-4f3e-88dd-f6c89e3c4c14","resolution":{"observed_at":"2026-08-02T18:47:52.159297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-03T02:39:29.691195Z","title":"Gated atten- tion for large language models: Non-linearity, sparsity, and attention-sink-free.arXiv preprint arXiv:2505.06708,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.06274","last_updated":"2026-07-31T10:15:33Z","snapshot_observed_at":"2026-08-06T17:36:40.046219Z","submitted_at":"2026-03-06T13:33:29Z","title":"Stem: Rethinking Causal Information Flow in Sparse Attention","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T02:39:29.691195Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2603.06274"},"observation_digest":"sha256:ad37f1c24e0ba91c547571debdf910c48945e3b1ff579b54232a002849a041a9","observation_id":"40e735d8-be69-4b9a-8617-1fb1e8a789f9","resolution":{"observed_at":"2026-08-03T02:39:29.691195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2603.24226","last_updated":"2026-05-22T10:41:18Z","snapshot_observed_at":"2026-08-02T18:41:19.105480Z","submitted_at":"2026-03-25T12:00:26Z","title":"Joint Model Parameter Scaling and Universal-Domain Data Integration for E-commerce Search Ranking","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-25T06:52:50.606682Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2603.24226"},"observation_digest":"sha256:462307ed9bab7a18f4103d0d3a54b0662a2d2ed1006f5a1c3d25698cb6eba980","observation_id":"1a31cce4-041e-4968-933d-53e59a6cbdba","resolution":{"observed_at":"2026-05-25T06:55:26.156840Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Gated attention for large language models: Non-linearity, sparsity, and attention-sink-free.arXiv preprint arXiv:2505.06708, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-07-13T18:42:32.163637Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:c7a1aabcf88ea24459c21b7bb72128403301f4359b8689a28c4602feff88c01b","observation_id":"9f1ce7c2-8d07-4dcd-9910-bad04b5284ec","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2603.26085","last_updated":"2026-04-09T08:45:46Z","snapshot_observed_at":"2026-08-02T06:47:45.283708Z","submitted_at":"2026-03-27T05:26:31Z","title":"AgenticRS-Architecture: System Design for Agentic Recommender Systems","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-14T23:22:11.492062Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2603.26085"},"observation_digest":"sha256:c5d1c2bbb44ba06f402ead040fac87fd9ecea4c3e2779655190f06baad06d669","observation_id":"47ad2a28-4f53-4f61-b3c0-647ec8b500ac","resolution":{"observed_at":"2026-05-14T23:23:15.920690Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2604.03190","last_updated":"2026-05-03T22:02:33Z","snapshot_observed_at":"2026-07-06T22:52:25.307426Z","submitted_at":"2026-04-03T17:06:08Z","title":"Gradient Boosting within a Single Attention Layer","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T20:23:40.027519Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2604.03190"},"observation_digest":"sha256:c9f6b1c2e20b9a9411144f9c19353bce4a8f90cadbc1f2f40ef51fce7a759aab","observation_id":"925b5ea5-2929-40b4-988d-19b754f8e1e0","resolution":{"observed_at":"2026-05-13T20:28:14.154524Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2604.05182","last_updated":"2026-07-22T21:33:06Z","snapshot_observed_at":"2026-08-02T16:46:05.370757Z","submitted_at":"2026-04-06T21:21:12Z","title":"LSRM: High-Fidelity Object-Centric Reconstruction via Scaled Context Windows","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T19:32:20.565326Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2604.05182"},"observation_digest":"sha256:867da97b26df4a6c99d239da71b7b68437544c0736a0681b9f71d85d9591cabf","observation_id":"eaac5441-7830-45f0-8894-295516c9e21a","resolution":{"observed_at":"2026-05-12T09:04:34.965110Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-07-13T09:33:39.204257Z","title":"arXiv preprint arXiv:2505.06708 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.05182","last_updated":"2026-07-22T21:33:06Z","snapshot_observed_at":"2026-08-02T16:46:05.370757Z","submitted_at":"2026-04-06T21:21:12Z","title":"LSRM: High-Fidelity Object-Centric Reconstruction via Scaled Context Windows","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-13T09:33:39.204257Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2604.05182"},"observation_digest":"sha256:d4ec81a17a8e8c77bd66519fc33a8764be46fc0bd6018c1d201ec25893ece07c","observation_id":"7634c9af-6064-430d-9ca6-4e05c69cc0d1","resolution":{"observed_at":"2026-07-13T09:33:39.204257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-02T16:46:06.560385Z","title":"arXiv preprint arXiv:2505.06708 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.05182","last_updated":"2026-07-22T21:33:06Z","snapshot_observed_at":"2026-08-02T16:46:05.370757Z","submitted_at":"2026-04-06T21:21:12Z","title":"LSRM: High-Fidelity Object-Centric Reconstruction via Scaled Context Windows","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T16:46:06.560385Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2604.05182"},"observation_digest":"sha256:7593c109b1627a0b99470cacb51f4778bde9084408b1d1b2b294d50a1e73313b","observation_id":"ecfb19e8-e101-4246-be3c-b7cad8f220d8","resolution":{"observed_at":"2026-08-02T16:46:06.560385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2604.05688","last_updated":"2026-04-07T10:40:16Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T10:40:16Z","title":"Attention Editing: A Versatile Framework for Cross-Architecture Attention Conversion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T19:47:34.869184Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2604.05688"},"observation_digest":"sha256:bbbfa061701c5bf337741a251cce9f42761dff44ed8c9152f58839918d89decf","observation_id":"aa9cd05a-365e-46d3-b97a-39293e5f12d7","resolution":{"observed_at":"2026-05-12T09:04:34.965110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2604.09793","last_updated":"2026-04-10T18:13:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-10T18:13:55Z","title":"GIANTS: Generative Insight Anticipation from Scientific Literature","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T17:03:15.684802Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2604.09793"},"observation_digest":"sha256:cb40a3f600940a04fb68f9564fccc6f09b9001d06dcef983e9835521bbe3cc58","observation_id":"42bbf5d8-f324-4500-a1cf-0e2f56946dff","resolution":{"observed_at":"2026-05-12T09:04:34.965110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2604.10103","last_updated":"2026-04-28T08:33:18Z","snapshot_observed_at":"2026-07-06T22:58:47.599383Z","submitted_at":"2026-04-11T08:54:07Z","title":"Long-Horizon Streaming Video Generation via Hybrid Attention with Decoupled Distillation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T16:10:54.363560Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2604.10103"},"observation_digest":"sha256:6ab833b4bcae743a286f02fa559123f55cb32545077698b10945d034282a4e68","observation_id":"edaa5544-700b-4f85-8d90-e8c020ac6ca3","resolution":{"observed_at":"2026-05-12T09:04:34.965110Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2604.13737","last_updated":"2026-04-15T11:25:46Z","snapshot_observed_at":"2026-07-06T23:01:41.643335Z","submitted_at":"2026-04-15T11:25:46Z","title":"TokenFormer: Unify the Multi-Field and Sequential Recommendation Worlds","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T12:47:50.618022Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2604.13737"},"observation_digest":"sha256:6518c7bd2b7adb6b4c89af0388ae548c288a94621784d27cf9dd175edbd4089d","observation_id":"6d32629e-1f77-4dfb-8262-4f4eb2dd7217","resolution":{"observed_at":"2026-05-12T09:04:34.965110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2604.14191","last_updated":"2026-04-01T09:23:08Z","snapshot_observed_at":"2026-07-06T23:02:00.082783Z","submitted_at":"2026-04-01T09:23:08Z","title":"Attention to Mamba: A Recipe for Cross-Architecture Distillation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T23:07:41.022051Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2604.14191"},"observation_digest":"sha256:6b8ed2bed99d44a03cbc6cc3464bf4b80b05a82d1765cd59fb61a3038581bd12","observation_id":"d0855b66-e95e-429e-8514-1aa397eeb832","resolution":{"observed_at":"2026-05-13T23:08:25.056159Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2604.15529","last_updated":"2026-05-11T04:41:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T21:19:35Z","title":"LACE: Lattice Attention for Cross-thread Exploration","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-10T10:24:16.283375Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2604.15529"},"observation_digest":"sha256:20300dc236fe360308b3191215d4521d97650109d5ca686457464b4a0a14b800","observation_id":"2083a784-fb0a-421b-84dc-5b45247c8a86","resolution":{"observed_at":"2026-05-12T09:04:34.965110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2604.15529","last_updated":"2026-05-11T04:41:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T21:19:35Z","title":"LACE: Lattice Attention for Cross-thread Exploration","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-11T00:47:51.440441Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2604.15529"},"observation_digest":"sha256:0c7158bd87aa7657f1e8d7aef8ed40a1af6708f659e13fdcf617d306056d04eb","observation_id":"ccdf69dd-2962-4cb8-954f-70c0d52c5ebe","resolution":{"observed_at":"2026-05-12T09:04:34.965110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2604.15529","last_updated":"2026-05-11T04:41:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T21:19:35Z","title":"LACE: Lattice Attention for Cross-thread Exploration","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-12T04:05:35.063305Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2604.15529"},"observation_digest":"sha256:26ba2bd35b99b65d3155cbfe3b70f9f98f5e61e78191f6b330c4cc71b762ca7c","observation_id":"ab999bb8-8044-42d6-941a-3afddfac6692","resolution":{"observed_at":"2026-05-12T09:04:34.965110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2604.16883","last_updated":"2026-04-18T07:23:22Z","snapshot_observed_at":"2026-08-03T01:53:31.909118Z","submitted_at":"2026-04-18T07:23:22Z","title":"SinkRouter: Sink-Aware Routing for Efficient Long-Context Decoding in Large Language and Multimodal Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T07:56:05.583390Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2604.16883"},"observation_digest":"sha256:86c2354921f34e3d4d10ac549bc601c7c005635342c3970cd996f8f93629a4a9","observation_id":"a656e895-1788-4b47-97b7-be4ba313bb8d","resolution":{"observed_at":"2026-05-12T09:04:34.965110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2604.18933","last_updated":"2026-08-03T20:19:45Z","snapshot_observed_at":"2026-08-07T15:13:00.838855Z","submitted_at":"2026-04-21T00:14:50Z","title":"Gated Memory Policy: In-Context Memorization and Adaptation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T03:16:21.448753Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2604.18933"},"observation_digest":"sha256:e02ece2c814423a929938a04335b92cb450fee5cc31a5a4c40fa2ff871ea88b3","observation_id":"84657d10-fb86-4fe1-9661-902a3c5b29a5","resolution":{"observed_at":"2026-05-12T09:04:34.965110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2604.23434","last_updated":"2026-04-25T20:12:21Z","snapshot_observed_at":"2026-07-06T23:09:38.799345Z","submitted_at":"2026-04-25T20:12:21Z","title":"When Does Removing LayerNorm Help? Activation Bounding as a Regime-Dependent Implicit Regularizer","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-08T08:29:58.495518Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2604.23434"},"observation_digest":"sha256:c682f17bce900e5777caf851548d7ac4f5cf2b79f947ffebb3fa41b1d353b906","observation_id":"ad0c0a03-d13f-43cb-9882-c3ea2b790a1b","resolution":{"observed_at":"2026-05-12T09:04:34.965110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2604.24715","last_updated":"2026-04-27T17:23:37Z","snapshot_observed_at":"2026-08-02T10:33:56.860167Z","submitted_at":"2026-04-27T17:23:37Z","title":"Long-Context Aware Upcycling: A New Frontier for Hybrid LLM Scaling","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T03:39:37.485602Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2604.24715"},"observation_digest":"sha256:667c987ad4e4eddf9f26d31345f1adc4ab04dd9de96323b1a11c315125f2a96c","observation_id":"ff78da4d-1d91-442d-8be2-c29a1a2cfe59","resolution":{"observed_at":"2026-05-12T09:04:34.965110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2604.27124","last_updated":"2026-04-29T19:23:30Z","snapshot_observed_at":"2026-07-30T04:24:50.826562Z","submitted_at":"2026-04-29T19:23:30Z","title":"Better Models, Faster Training: Sigmoid Attention for single-cell Foundation Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-07T09:14:43.547868Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2604.27124"},"observation_digest":"sha256:517867bdae605921ec4879d2e556bc2be4eaa20188e0c1af71989be22eb18f1a","observation_id":"8f2dedcd-1993-46d8-a0e6-e3d9e727bad7","resolution":{"observed_at":"2026-05-12T09:46:27.682758Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2604.27351","last_updated":"2026-04-30T03:02:27Z","snapshot_observed_at":"2026-07-06T23:12:52.141592Z","submitted_at":"2026-04-30T03:02:27Z","title":"Heterogeneous Scientific Foundation Model Collaboration","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-07T08:50:05.980191Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2604.27351"},"observation_digest":"sha256:b4262cf74c78ec69781ad479211c4affa85326b9512dcfb702f7f2bb7bda1c1a","observation_id":"81f35d6c-e137-42eb-8d8c-b2c4c2ac24d1","resolution":{"observed_at":"2026-05-12T09:04:34.965110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2605.00809","last_updated":"2026-06-09T13:08:44Z","snapshot_observed_at":"2026-08-02T08:22:53.063329Z","submitted_at":"2026-05-01T17:51:38Z","title":"Let ViT Speak: Generative Language-Image Pre-training","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-09T18:56:51.627714Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2605.00809"},"observation_digest":"sha256:ef1643e7b488fdc5900edcc8f39315cd647037c078ce074ce7963a093dc1e8d1","observation_id":"68127f9f-726e-4df4-a19e-25f462d4f683","resolution":{"observed_at":"2026-05-12T09:04:34.965110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2605.00809","last_updated":"2026-06-09T13:08:44Z","snapshot_observed_at":"2026-08-02T08:22:53.063329Z","submitted_at":"2026-05-01T17:51:38Z","title":"Let ViT Speak: Generative Language-Image Pre-training","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-01T07:35:07.825460Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2605.00809"},"observation_digest":"sha256:625dc056f67c81f9a3ad31b8db81af91b3fe75c6bc9fe0f807365436cab93633","observation_id":"5725efbf-e6a5-47cd-9845-ba7a22aca466","resolution":{"observed_at":"2026-07-01T07:35:28.744600Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2605.01236","last_updated":"2026-05-02T04:18:43Z","snapshot_observed_at":"2026-08-06T04:17:49.804332Z","submitted_at":"2026-05-02T04:18:43Z","title":"Degradation-Aware Adaptive Context Gating for Unified Image Restoration","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-09T15:11:05.310951Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2605.01236"},"observation_digest":"sha256:626a5cec833980d1f93001268fedd7e3d4436cfb30dfeb2a05c673072daa3660","observation_id":"c9cd7ee6-010d-4ce0-8309-1eb79b91496f","resolution":{"observed_at":"2026-05-12T09:04:34.965110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2605.01376","last_updated":"2026-05-02T10:55:40Z","snapshot_observed_at":"2026-07-06T23:14:38.379875Z","submitted_at":"2026-05-02T10:55:40Z","title":"A Cellular Doctrine of Morality: Intrinsic Active Precision and the Mind-Reality Overload Dilemma","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-09T14:26:52.393248Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2605.01376"},"observation_digest":"sha256:5946c565c4b95448945abaef04630acd3d8278e409bfff0fa69e7c348bbda112","observation_id":"c5148abd-78f5-4120-a522-871d1d5690f1","resolution":{"observed_at":"2026-05-12T09:04:34.965110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2605.02278","last_updated":"2026-05-04T07:09:39Z","snapshot_observed_at":"2026-08-03T01:39:18.064763Z","submitted_at":"2026-05-04T07:09:39Z","title":"HELIX: Hybrid Encoding with Learnable Identity and Cross-dimensional Synthesis for Time Series Imputation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-08T18:32:03.529875Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2605.02278"},"observation_digest":"sha256:7c1aa95eabe11c738b6ef8c7cf25c611fd70ad0c7afffd650281aaa95e8f8240","observation_id":"5d5a33ea-5e1e-4e9a-84d4-f3b1f088ba0f","resolution":{"observed_at":"2026-05-12T09:04:34.965110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2605.04421","last_updated":"2026-05-06T02:27:25Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:27:25Z","title":"FLUID: Continuous-Time Hyperconnected Sparse Transformer for Sink-Free Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-08T17:39:25.534863Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2605.04421"},"observation_digest":"sha256:87ff178907c943f5a71ed6318a817c7cabea788c7fcce92e95d429b58b0db4e9","observation_id":"ed8e43f4-fde3-48a8-ae7a-0ebd7b667b63","resolution":{"observed_at":"2026-05-12T09:04:34.965110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2605.05365","last_updated":"2026-05-06T18:44:08Z","snapshot_observed_at":"2026-08-04T22:00:35.849220Z","submitted_at":"2026-05-06T18:44:08Z","title":"ZAYA1-8B Technical Report","version":1},"reference_index":204,"source":"arxiv_source","source_observed_at":"2026-05-08T17:36:37.182196Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2605.05365"},"observation_digest":"sha256:bdeac4907c761cd0650961fecb9f78b9589a0e6652672daffca9cc502677d273","observation_id":"d4e66e01-7836-4a00-9fcc-a87172dd1b2e","resolution":{"observed_at":"2026-05-12T09:04:34.965110Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-08T12:38:19.925573Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:0b6907f239609900e134dbf8edf25314664e4bcfbfaff92e301f22230d6daf2b","observation_id":"25137451-69cf-47e4-9448-59114c33f457","resolution":{"observed_at":"2026-05-12T09:04:34.965110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:a4d1a504b88e82d29ff661bd7fbda72b70a17dea15b63e1a19a69d25aa93cf29","observation_id":"ec011d2a-6ed9-4e90-98af-c8e53f0e38ff","resolution":{"observed_at":"2026-05-20T22:39:11.014913Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2605.06611","last_updated":"2026-05-07T17:28:55Z","snapshot_observed_at":"2026-08-03T12:02:38.374401Z","submitted_at":"2026-05-07T17:28:55Z","title":"The Structural Origin of Attention Sink: Variance Discrepancy, Super Neurons, and Dimension Disparity","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T12:11:04.146711Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2605.06611"},"observation_digest":"sha256:724b3bc0b6eeaef308052d7a21b699bfb7c1711ac8a0c3e62c34f9eb1c976891","observation_id":"d4eccbe9-c28f-42da-89b8-91d679aa685d","resolution":{"observed_at":"2026-05-12T09:04:34.965110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2605.07326","last_updated":"2026-05-08T06:32:12Z","snapshot_observed_at":"2026-07-30T05:23:33.496468Z","submitted_at":"2026-05-08T06:32:12Z","title":"GEM: Generating LiDAR World Model via Deformable Mamba","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-11T01:31:09.604703Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2605.07326"},"observation_digest":"sha256:5abff41aa63322774f8ad5ad2496ac2efd50284286e49ca6a4e97ab95878b7a1","observation_id":"550c6bd5-0f61-4471-b454-e749db7bd390","resolution":{"observed_at":"2026-05-12T09:04:34.965110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2605.08504","last_updated":"2026-05-12T18:33:07Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T21:37:27Z","title":"A Single Layer to Explain Them All:Understanding Massive Activations in Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T02:29:20.796512Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2605.08504"},"observation_digest":"sha256:7db39153e0d86e92f198e5ccd7e63f4698c95a0d15501cad524319c1c3d0bfdb","observation_id":"31356f94-8b24-45a3-bfb6-3560282953c4","resolution":{"observed_at":"2026-05-12T09:04:34.965110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2605.08504","last_updated":"2026-05-12T18:33:07Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T21:37:27Z","title":"A Single Layer to Explain Them All:Understanding Massive Activations in Large Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-14T21:03:25.624300Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2605.08504"},"observation_digest":"sha256:d206b854b76cd4921a9f39f5f2fe72499a18013fe4c347dd7a1c67557da0e7bc","observation_id":"7e3029d2-b9df-457c-8b19-6e493226bef6","resolution":{"observed_at":"2026-05-14T21:19:29.128327Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2605.08738","last_updated":"2026-05-18T06:29:11Z","snapshot_observed_at":"2026-07-06T23:20:57.084438Z","submitted_at":"2026-05-09T06:50:35Z","title":"SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-12T03:34:10.370956Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2605.08738"},"observation_digest":"sha256:153f4296f88727658c90e0c67a46206f9e698d1b91fb9b30e796d1860beec206","observation_id":"f7ff4173-f9ca-46ea-8457-33bac8f0992d","resolution":{"observed_at":"2026-05-12T09:04:34.965110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2605.08738","last_updated":"2026-05-18T06:29:11Z","snapshot_observed_at":"2026-07-06T23:20:57.084438Z","submitted_at":"2026-05-09T06:50:35Z","title":"SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-20T23:22:51.808346Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2605.08738"},"observation_digest":"sha256:ba0b6764a82230e9de6520372ea0ad3defc7a370d64e785a8bef7ac25559e378","observation_id":"77d16551-9a87-4096-856c-9bce7c1d8a30","resolution":{"observed_at":"2026-05-20T23:23:51.159285Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2605.09196","last_updated":"2026-05-09T22:31:09Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-09T22:31:09Z","title":"RigidFormer: Learning Rigid Dynamics using Transformers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T02:18:19.764706Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2605.09196"},"observation_digest":"sha256:f3c0d6f3a03519ad61d2c2e91551a3a0b1f5c1825fe48a40c71f91a90d1a7dc0","observation_id":"54d58277-a2c2-4cba-90b5-e89ed8ef434c","resolution":{"observed_at":"2026-05-12T09:04:34.965110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2605.10359","last_updated":"2026-05-11T11:05:04Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T11:05:04Z","title":"Learning-Based Spectrum Cartography in Low Earth Orbit Satellite Networks: An Overview","version":1},"reference_index":132,"source":"pdf_text","source_observed_at":"2026-05-12T04:52:12.288356Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2605.10359"},"observation_digest":"sha256:4fe5bff50f0fccbf991f173a7393447f7d284b382ef4bd8de59d08e1c8eb510d","observation_id":"d17e455a-db99-41a9-b7ec-79264f63dcce","resolution":{"observed_at":"2026-05-12T09:04:34.965110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2605.10537","last_updated":"2026-05-11T13:20:51Z","snapshot_observed_at":"2026-07-06T23:22:28.318343Z","submitted_at":"2026-05-11T13:20:51Z","title":"Mela: Test-Time Memory Consolidation based on Transformation Hypothesis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:01.993926Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2605.10537"},"observation_digest":"sha256:3da03a39c40f8523e0da92b916e2a34e63fabb6e50c0903ffb0f75e204000329","observation_id":"d3ae8cea-dd6f-4f25-abef-9c407274d267","resolution":{"observed_at":"2026-05-12T09:04:34.965110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2605.15336","last_updated":"2026-05-19T03:46:27Z","snapshot_observed_at":"2026-07-06T23:26:37.362117Z","submitted_at":"2026-05-14T18:59:43Z","title":"HoloMotion-1 Technical Report","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T16:03:26.677537Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2605.15336"},"observation_digest":"sha256:ae971224897d86f40c11dbe869b08ad8d5ac613c68772dff4be5b88f5d22b463","observation_id":"c20a0ffa-543b-4e1d-8073-48ce5ba1d396","resolution":{"observed_at":"2026-05-19T16:12:39.703943Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2605.15336","last_updated":"2026-05-19T03:46:27Z","snapshot_observed_at":"2026-07-06T23:26:37.362117Z","submitted_at":"2026-05-14T18:59:43Z","title":"HoloMotion-1 Technical Report","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T20:31:35.070451Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2605.15336"},"observation_digest":"sha256:26a76d2490ad7796ae79356d87c95081aa12d8c2fa2bb23e9908567b59331b4c","observation_id":"555c89b1-098c-4678-a7ce-5d80b21a217a","resolution":{"observed_at":"2026-05-20T20:33:43.157281Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2605.16147","last_updated":"2026-07-06T18:29:27Z","snapshot_observed_at":"2026-08-03T00:35:38.299188Z","submitted_at":"2026-05-15T16:27:10Z","title":"Registers Matter for Pixel-Space Diffusion Transformers","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-20T19:08:23.052621Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2605.16147"},"observation_digest":"sha256:81d4a0b875c9598c4ba405efd8e2f66a1de886f5887200682ceada92b4c1f75e","observation_id":"b220c595-3a3f-40f1-bbd7-287261d2effc","resolution":{"observed_at":"2026-05-20T19:08:54.039719Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2605.20798","last_updated":"2026-05-20T06:43:34Z","snapshot_observed_at":"2026-08-02T17:01:43.729235Z","submitted_at":"2026-05-20T06:43:34Z","title":"Most Transformer Modifications Still Do Not Transfer at 1-3B: A 2020-2026 Update to Narang et al. (2021) with Downstream Evaluation and a Noise Floor","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-21T06:15:47.451870Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2605.20798"},"observation_digest":"sha256:2bc72b5e0ffc014820f1689c31c22ddfa370c3ffeb51db54622350c6ba50f6c6","observation_id":"fb6591b3-dbbc-4fb1-9c4d-787185775c49","resolution":{"observed_at":"2026-05-21T06:19:42.056549Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2605.23889","last_updated":"2026-05-22T17:50:48Z","snapshot_observed_at":"2026-08-03T03:54:18.940526Z","submitted_at":"2026-05-22T17:50:48Z","title":"HorizonStream: Long-Horizon Attention for Streaming 3D Reconstruction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-25T04:33:48.127707Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2605.23889"},"observation_digest":"sha256:26310c586665ec5268f22a06763281ddb64c7cbe85b6432e4535dfb613899bf2","observation_id":"a5f3f0ea-8ace-4d80-a8b3-5662a8a41f27","resolution":{"observed_at":"2026-05-25T04:35:20.830525Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2605.25244","last_updated":"2026-05-24T20:04:19Z","snapshot_observed_at":"2026-07-06T23:35:11.987278Z","submitted_at":"2026-05-24T20:04:19Z","title":"Inference Time Optimization with Confidence Dynamics","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T11:12:46.757296Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2605.25244"},"observation_digest":"sha256:e86effb6e0674875372b65affd3c389ee91e0c21b8c04d41e5ab7c57e633addb","observation_id":"b8790965-308c-4768-9fab-c3de4398cba1","resolution":{"observed_at":"2026-06-30T11:14:37.619553Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2605.28077","last_updated":"2026-05-27T07:32:13Z","snapshot_observed_at":"2026-08-04T08:12:57.206254Z","submitted_at":"2026-05-27T07:32:13Z","title":"MACReD: A Multi-Agent Collaborative Reasoning Framework for Reaction Diagram Parsing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T12:33:27.860796Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2605.28077"},"observation_digest":"sha256:cc95ab491b504a653ba71c319aa46905e711be78b5cdacaed9d57a8e784d7793","observation_id":"2bbb6b89-42b9-4e28-801e-b39bf8472521","resolution":{"observed_at":"2026-06-29T12:43:26.137383Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2605.28384","last_updated":"2026-05-27T12:21:28Z","snapshot_observed_at":"2026-08-01T10:47:24.351788Z","submitted_at":"2026-05-27T12:21:28Z","title":"Meta-Attention: Bayesian Per-Token Routing for Efficient Transformer Inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T14:44:08.335157Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2605.28384"},"observation_digest":"sha256:e8741e2e2e2f80e2f857233962719e6a75b6271a45e1e5db60d89927c571a63f","observation_id":"bd8b8d80-e78d-44ea-9af6-6eaa1b4f3881","resolution":{"observed_at":"2026-06-29T14:53:31.426670Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2605.28961","last_updated":"2026-05-27T18:06:41Z","snapshot_observed_at":"2026-08-01T20:38:26.983319Z","submitted_at":"2026-05-27T18:06:41Z","title":"Dynamics of Stochastic Momentum with Sparse Updates in High Dimensions","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T09:37:08.718061Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2605.28961"},"observation_digest":"sha256:a300291e81ec39d5eeb67575b27a27c7799fd35bc458be560a4a055d7ac85aa0","observation_id":"1c88a9ab-a526-48cd-97fb-b2017a19223a","resolution":{"observed_at":"2026-06-29T10:03:17.598092Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2606.04491","last_updated":"2026-06-03T06:14:48Z","snapshot_observed_at":"2026-08-02T04:52:56.906602Z","submitted_at":"2026-06-03T06:14:48Z","title":"NuGNN: a Graph Neural Network for Nuclear Reaction Network Equations","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T04:29:24.642291Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2606.04491"},"observation_digest":"sha256:3b0404877cb19bf6b02388694ac083068036b69b9db8bca92f314e3d4bcfca7e","observation_id":"082140ca-8cd1-4090-9133-1dfc69cc8858","resolution":{"observed_at":"2026-06-28T04:31:39.363353Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2606.07604","last_updated":"2026-05-29T09:40:38Z","snapshot_observed_at":"2026-08-03T04:00:50.272221Z","submitted_at":"2026-05-29T09:40:38Z","title":"Contribution Weights: A Geometrical Analysis of Self-Attention Transformers","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-06-28T23:29:02.457697Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2606.07604"},"observation_digest":"sha256:2555c9b9cd52cb565911975a8d80b1e251e5004442fafc956afaabc319cac8a4","observation_id":"12ca6e68-bd80-4410-bbad-8227896f7975","resolution":{"observed_at":"2026-06-28T23:32:46.579273Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2606.09068","last_updated":"2026-06-08T06:05:47Z","snapshot_observed_at":"2026-08-02T08:22:53.597386Z","submitted_at":"2026-06-08T06:05:47Z","title":"Emergent Misalignment Can Be Induced by Sycophancy and Reversed via Alignment Gating","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-27T17:03:33.199645Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2606.09068"},"observation_digest":"sha256:cf6b128ed58a44645fb89d75d7272758173f0c40283ca096f2e3417864a7c87b","observation_id":"304325bb-2013-4930-9647-402ea341c43b","resolution":{"observed_at":"2026-07-03T00:47:29.992991Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2606.11382","last_updated":"2026-06-09T19:05:58Z","snapshot_observed_at":"2026-07-06T23:50:30.023802Z","submitted_at":"2026-06-09T19:05:58Z","title":"GLACIER: A Multimodal Student-Teacher Foundation Model for Molecular Property Prediction","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T13:59:11.915458Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2606.11382"},"observation_digest":"sha256:6ff9b3ea0840930554e97e18289b4bb544b6af0c34adbf823629a8a9e0463c35","observation_id":"cb2fa227-33cc-498a-a96d-b5951d68e200","resolution":{"observed_at":"2026-06-27T14:00:59.321902Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2606.19002","last_updated":"2026-06-17T12:28:47Z","snapshot_observed_at":"2026-07-06T23:54:23.090538Z","submitted_at":"2026-06-17T12:28:47Z","title":"Enhancing Multilingual Reasoning via Steerable Model Merging","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-26T20:37:26.295906Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2606.19002"},"observation_digest":"sha256:549ebef78d2f8f3be920ef5789f47a29e015419ddf73541a24210c85c0d83c2c","observation_id":"a3e7cf88-a1da-4a62-b7c6-1dbb1a765283","resolution":{"observed_at":"2026-06-26T20:39:56.013606Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2606.19853","last_updated":"2026-06-18T07:01:14Z","snapshot_observed_at":"2026-08-06T15:30:48.586335Z","submitted_at":"2026-06-18T07:01:14Z","title":"Physics-Informed Neural Network with Squeeze-Excitation-like Attention","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-26T18:02:39.721547Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2606.19853"},"observation_digest":"sha256:c136056a344dda7b4a609310c742bc6b1682b28aa10ee42a771594e51fe09c1c","observation_id":"4977a195-6311-4017-b7dc-5f5f1c99f7fb","resolution":{"observed_at":"2026-07-04T03:29:30.221194Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2606.20027","last_updated":"2026-06-18T09:58:50Z","snapshot_observed_at":"2026-08-02T22:03:12.917924Z","submitted_at":"2026-06-18T09:58:50Z","title":"QG-MIL: A Gated Transformer Aggregator for Domain-Agnostic Multiple Instance Learning in Medical Imaging","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T18:26:38.811327Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2606.20027"},"observation_digest":"sha256:183dd4c239e7f1c6e429779c9fb64fde29ed971f0a26b012033d6bd9c8c03f4e","observation_id":"a21c9084-b358-4c53-9610-8a1e1a6bea9a","resolution":{"observed_at":"2026-07-04T03:09:29.299310Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2606.23670","last_updated":"2026-06-22T17:56:25Z","snapshot_observed_at":"2026-07-06T23:58:20.975630Z","submitted_at":"2026-06-22T17:56:25Z","title":"Tapered Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T09:11:20.341634Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2606.23670"},"observation_digest":"sha256:03cc4aa4086d56112988ddc5cb60b86fbdf08a7edf0407cf348566eb4c25be1e","observation_id":"2b95b062-f817-4f23-9d07-7af82b3be829","resolution":{"observed_at":"2026-07-04T10:09:44.028492Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2606.24320","last_updated":"2026-06-25T20:48:22Z","snapshot_observed_at":"2026-07-06T23:58:54.018557Z","submitted_at":"2026-06-23T08:57:34Z","title":"ZONOS2 Technical Report","version":1},"reference_index":245,"source":"arxiv_source","source_observed_at":"2026-06-25T22:37:15.072758Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2606.24320"},"observation_digest":"sha256:328077fbdb496967426ead045113e08925a895c50ca232f37415914a33484e15","observation_id":"05fa2581-f02b-4f39-8813-3504db4ec9a7","resolution":{"observed_at":"2026-07-04T18:40:03.189541Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2606.24320","last_updated":"2026-06-25T20:48:22Z","snapshot_observed_at":"2026-07-06T23:58:54.018557Z","submitted_at":"2026-06-23T08:57:34Z","title":"ZONOS2 Technical Report","version":2},"reference_index":245,"source":"arxiv_source","source_observed_at":"2026-06-29T02:07:31.791835Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2606.24320"},"observation_digest":"sha256:c859786b4e64fb1f261178d4471445ce924f584c54f63b4474b12498d14e0fd4","observation_id":"05f332bf-385b-4106-86bd-faeef8ebd2e8","resolution":{"observed_at":"2026-07-01T18:15:59.083536Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2606.25136","last_updated":"2026-06-23T20:07:23Z","snapshot_observed_at":"2026-07-06T23:59:37.533078Z","submitted_at":"2026-06-23T20:07:23Z","title":"Memory Retrieval in Visuomotor Policies for Long-Horizon Robot Control","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-25T23:51:39.882029Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2606.25136"},"observation_digest":"sha256:c69b1c2001e94f29710a8eca9012de61088d8858eba50f1de9aba482d94446c2","observation_id":"e70b8b98-3b18-46b3-bb8e-d7a1616cb757","resolution":{"observed_at":"2026-07-04T17:09:59.580966Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2606.26016","last_updated":"2026-07-08T10:57:01Z","snapshot_observed_at":"2026-08-02T07:36:10.167129Z","submitted_at":"2026-06-24T16:37:10Z","title":"MIMFlow: Integrating Masked Image Modeling with Normalizing Flows for End-to-End Image Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-25T19:34:02.046104Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2606.26016"},"observation_digest":"sha256:bc89227d060b53786c4f162648a21b1a866c24e9f8898aa990f70b18df7abf3e","observation_id":"68396d77-711d-4937-b619-c85cc6908f2f","resolution":{"observed_at":"2026-07-04T20:50:11.376633Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2606.26556","last_updated":"2026-06-25T03:07:34Z","snapshot_observed_at":"2026-07-07T00:00:51.779266Z","submitted_at":"2026-06-25T03:07:34Z","title":"WQ-Fusion: Dynamic Gated Attention for Cross-Domain Audio Representation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T03:21:39.842959Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2606.26556"},"observation_digest":"sha256:ae7ac3e261b57abba0a23f2e7134171ad326d015a0e91f02ad748885c21d9120","observation_id":"3db5491e-cbb9-40b3-8ba1-7f328006fd93","resolution":{"observed_at":"2026-07-04T14:39:57.192372Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2606.31248","last_updated":"2026-06-30T07:24:33Z","snapshot_observed_at":"2026-08-05T18:41:32.185878Z","submitted_at":"2026-06-30T07:24:33Z","title":"Scaling Storm-Resolving Atmospheric AI Simulation to the Entire Planet","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-01T02:59:29.125298Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2606.31248"},"observation_digest":"sha256:ac6cac13a96ba5735687a6c7c88bace434248fdd08b699d71b209544c85f7066","observation_id":"b0c0e05f-a3fd-4078-b302-d0db223c6e4d","resolution":{"observed_at":"2026-07-01T12:05:42.850070Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-07-12T05:47:14.970921Z","title":"Gated attention for large language models: Non-linearity, sparsity, and attention-sink-free.arXiv preprint arXiv:2505.06708, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02966","last_updated":"2026-07-09T05:23:35Z","snapshot_observed_at":"2026-08-03T16:28:26.579827Z","submitted_at":"2026-07-03T05:17:48Z","title":"Distill Where the Student Goes: Teacher-Regularized RL for English-Evidence Cross-Lingual RAG","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-12T05:47:14.970921Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2607.02966"},"observation_digest":"sha256:c0bfc95372b3393a499ad592c9929f7fddb11801625ac22610300bc3c3897723","observation_id":"0a4e7380-566f-4dce-885f-15d95957612a","resolution":{"observed_at":"2026-07-12T05:47:14.970921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2607.07386","last_updated":"2026-07-08T13:17:19Z","snapshot_observed_at":"2026-08-06T16:46:55.298935Z","submitted_at":"2026-07-08T13:17:19Z","title":"Sparse Delta Memory: Scaling the State of Linear RNNs through Sparsity","version":1},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-07-09T12:40:09.036905Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2607.07386"},"observation_digest":"sha256:1ddc2613034f1432ba98a8186a92b21b2b2ccb02dd1d403911aaeecf4096bd35","observation_id":"a6a1b239-3378-42fa-b8f6-fc9d1b29f4be","resolution":{"observed_at":"2026-07-09T12:46:14.643488Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-07-14T03:25:28.859078Z","title":"Gated attention for large language models: Non-linearity, sparsity, and attention-sink-free.arXiv preprint arXiv:2505.06708, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11754","last_updated":"2026-07-13T16:12:29Z","snapshot_observed_at":"2026-07-16T23:20:00.211022Z","submitted_at":"2026-07-13T16:12:29Z","title":"Higher-Order Cell Tracking Transformer","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-14T03:25:28.859078Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2607.11754"},"observation_digest":"sha256:6d2680b943fe0d5edcfbc8fdaf28adb989edec229d7e8d02a56c68a3a9a2f5a5","observation_id":"651f180f-6528-4db2-9654-47a0eeded357","resolution":{"observed_at":"2026-07-14T03:25:28.859078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-02T09:50:21.593887Z","title":"Gated attention for large language models: Non-linearity, sparsity, and attention-sink-free,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16251","last_updated":"2026-06-27T02:56:46Z","snapshot_observed_at":"2026-08-06T15:16:34.197063Z","submitted_at":"2026-06-27T02:56:46Z","title":"Learning Spatio-Temporal Foundation Models from Pure Synthetic Data","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T09:50:21.593887Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2607.16251"},"observation_digest":"sha256:c2a819ba5a4b0957f0b6a86db2352471bf929789b4f3325457482bb2f8b68972","observation_id":"5bfcc3a3-82c9-46ae-a547-06add249eac1","resolution":{"observed_at":"2026-08-02T09:50:21.593887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-01T16:19:08.214613Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18363","last_updated":"2026-07-20T15:29:00Z","snapshot_observed_at":"2026-08-07T09:36:32.385604Z","submitted_at":"2026-07-20T15:29:00Z","title":"A Controlled Study of Attention-Only Transformers","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T16:19:08.214613Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2607.18363"},"observation_digest":"sha256:e2a4b3fb3a72a5ef84e8cb04922a3f021b68a10c245445b580ff13257546414d","observation_id":"07381105-25cd-4c2f-92b9-32f906cf5671","resolution":{"observed_at":"2026-08-01T16:19:08.214613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-01T07:09:07.598100Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T22:42:28.999422Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:07.598100Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:13ebe33488906df9c47b875366daa224b75cd097e70e1a298c6918d8ae6a0d31","observation_id":"cced871c-cbd8-48f4-bf59-aee4cac671e4","resolution":{"observed_at":"2026-08-01T07:09:07.598100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-01T11:39:23.239954Z","title":"Gated attention for large language models: Non-linearity, sparsity, and attention-sink-free.arXiv preprint arXiv:2505.06708,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-06T23:11:28.294466Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T11:39:23.239954Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:9d846955f175f16d8b78c273e8a7902de7ed4fc3215ccf368f86b1a284117bbc","observation_id":"4b9e3460-be13-44e7-8036-003aff7128e8","resolution":{"observed_at":"2026-08-01T11:39:23.239954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-04T01:39:48.142895Z","title":"Gated attention for large language models: Non-linearity, sparsity, and attention-sink-free.arXiv preprint arXiv:2505.06708,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-06T23:11:28.294466Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:48.142895Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:ec0535c615c7e9fb17fcdfbcd12a8e1fe1591f79c30fce90aef0a625ec4b6057","observation_id":"066941b7-06c5-4da0-b5ea-677bcaf10f87","resolution":{"observed_at":"2026-08-04T01:39:48.142895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-01T09:52:09.594240Z","title":"arXiv preprint arXiv:2505.06708 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27308","last_updated":"2026-07-29T17:49:04Z","snapshot_observed_at":"2026-08-05T10:53:49.344314Z","submitted_at":"2026-07-29T17:49:04Z","title":"ZUNA1.1: A more flexible EEG foundation model for Denoising and Super-resolution","version":1},"reference_index":214,"source":"arxiv_source","source_observed_at":"2026-08-01T09:52:09.594240Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2607.27308"},"observation_digest":"sha256:244725914bb6557df8937f3fa03005f12bcc1cb2c8d6e6905468886d0d112bdd","observation_id":"6d7637e3-367a-449d-b3d9-dd58750cd97e","resolution":{"observed_at":"2026-08-01T09:52:09.594240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.06708/citation-record","integrity":"/paper/2505.06708/integrity","json":"/paper/2505.06708/citation-record.json","paper":"/paper/2505.06708"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":"2305.13245","doi":"10.48550/arxiv.2305.13245","metadata_source":"pith","pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","venue":"cs.CL","work_id":"b73ad5b2-e553-4c71-b0c9-67e67ba7b158","year":2023},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:2b0e0cd780b2858ada57881890bc9e39e91893b7ec39c3053b5f980d24e2f1ce","observation_id":"97912554-94d4-4cf7-936e-6d34bcef2eff","resolution":{"observed_at":"2026-05-12T09:04:34.858173Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10251","last_updated":"2026-06-22T07:24:38Z","snapshot_observed_at":"2026-07-06T20:51:55.188153Z","submitted_at":"2025-03-13T10:53:17Z","title":"Numerical stability analysis of large language models","version":2},"cited_work":{"arxiv_id":"2503.10251","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10251","snapshot_observed_at":"2026-06-23T04:13:38.174619Z","title":"Numerical error analysis of large language models.arXiv preprint arXiv:2503.10251","venue":null,"work_id":"c741b40e-25fc-4291-979e-03ad56e0fe13","year":2025},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2503.10251","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:7b0473844f25bef0e3492ce26520b86c518731bdc988a403b4ade6f1e6d1a7e9","observation_id":"70532bf2-c7fa-43a7-979c-e5295f1f2c6d","resolution":{"observed_at":"2026-06-23T04:13:38.174619Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15595","last_updated":"2023-06-28T04:26:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-27T16:26:26Z","title":"Extending Context Window of Large Language Models via Positional Interpolation","version":2},"cited_work":{"arxiv_id":"2306.15595","doi":"10.48550/arxiv.2306.15595","metadata_source":"pith","pith_arxiv_id":"2306.15595","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Extending Context Window of Large Language Models via Positional Interpolation","venue":"cs.CL","work_id":"c8b6df85-e7da-4bd8-90a4-d309cc2a0f60","year":2023},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2306.15595","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:504f3be555b86625446991343fa5cbe100dbf680cba93027bf76b69a67d3db3a","observation_id":"64175e53-3209-47b6-a2ce-246e35f1ec77","resolution":{"observed_at":"2026-05-13T10:20:58.016961Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-01T10:38:12.283235+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T10:38:12.283235+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:bb6ab9aa460dbaa1fd40e60d860b258926eb8a1345ad834181e8bd85917fe82b","observation_id":"dcd9a6e4-6f5c-4bf0-a7ce-8ed1ce327d3e","resolution":{"observed_at":"2026-05-12T09:04:34.842259Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10837","last_updated":"2023-11-21T13:58:00Z","snapshot_observed_at":"2026-07-06T16:34:11.453458Z","submitted_at":"2023-10-16T21:23:16Z","title":"Approximating Two-Layer Feedforward Networks for Efficient Transformers","version":3},"cited_work":{"arxiv_id":"2310.10837","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10837","snapshot_observed_at":"2026-07-01T07:35:29.119466Z","title":"Approximating two-layer feedforward networks for efficient transformers.arXiv preprint arXiv:2310.10837","venue":null,"work_id":"f5009881-2b7f-4c4d-9d59-12451474cafc","year":2023},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2310.10837","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:bbbc73e3eeea28fb289469728ef508d090c155f9b10aafa513ead6502a499a4a","observation_id":"c26bf0d3-ad0a-47c4-97eb-d68aea22306b","resolution":{"observed_at":"2026-05-12T09:04:34.846334Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16039","last_updated":"2024-10-13T04:46:00Z","snapshot_observed_at":"2026-07-06T18:19:42.946629Z","submitted_at":"2024-05-25T03:24:32Z","title":"MoEUT: Mixture-of-Experts Universal Transformers","version":2},"cited_work":{"arxiv_id":"2405.16039","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.16039","snapshot_observed_at":"2026-07-04T01:09:18.548390Z","title":"Moeut: Mixture-of-experts universal transformers.arXiv preprint arXiv:2405.16039, 2024a","venue":null,"work_id":"d52cf961-b2a0-4c35-ae10-6fe0b4f5606f","year":2024},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2405.16039","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:33accdd9f45bb0aa597e1f88dbb5700f1a98bb35a2f73667ed9f9a6ac349c9b1","observation_id":"5c149812-9858-4e70-91db-36b473469cd7","resolution":{"observed_at":"2026-05-12T09:04:34.850063Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformers are ssms: Generalized models and efficient algorithms through structured state space duality","venue":null,"work_id":"d26d80fa-37de-4369-8bc4-d8ec25156842","year":2024},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:ccc3f62806ccb0a47395829d4f089152ebfd84c2fe70056b275bf1c27eb8c010","observation_id":"2f11968f-fa69-4f79-babf-1adebdd2b943","resolution":{"observed_at":"2026-05-12T09:04:34.962135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16588","last_updated":"2024-04-12T09:38:33Z","snapshot_observed_at":"2026-08-07T09:40:32.614733Z","submitted_at":"2023-09-28T16:45:46Z","title":"Vision Transformers Need Registers","version":2},"cited_work":{"arxiv_id":"2309.16588","doi":"10.48550/arxiv.2309.16588","metadata_source":"pith","pith_arxiv_id":"2309.16588","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision Transformers Need Registers","venue":"cs.CV","work_id":"57106da4-5420-4778-94eb-e821589aa7a0","year":2023},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2309.16588","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:f4a9d72a82e2c95b95dcb406c49cb197cb6af6de962289fc54257ccffc13bd3a","observation_id":"94c1d6b0-5792-40ac-b6f9-58627ad7fd48","resolution":{"observed_at":"2026-05-13T09:41:38.514155Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07365","last_updated":"2025-05-28T08:04:23Z","snapshot_observed_at":"2026-08-05T15:33:58.371700Z","submitted_at":"2025-02-11T08:37:16Z","title":"LongReD: Mitigating Short-Text Degradation of Long-Context Large Language Models via Restoration Distillation","version":3},"cited_work":{"arxiv_id":"2502.07365","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07365","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2502.07365 , year=","venue":null,"work_id":"9c0db21b-dfc3-491c-9528-9331057c6651","year":null},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2502.07365","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:590aaaf0d3e94ba8811da295449b9168e2031cc5aeff4c8b4288a67bc1f4051c","observation_id":"617e6ebe-0213-471a-8ec9-013f266d4bf0","resolution":{"observed_at":"2026-05-12T09:04:34.866219Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":"2312.00752","doi":"10.48550/arxiv.2312.00752","metadata_source":"pith","pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","venue":"cs.LG","work_id":"4ee75248-1199-492c-a52f-6661e0f4adff","year":2023},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:99cea3c5bdf6afa4d14448a129c739f13e2c2beb3bbe290cb6acdf34a456356b","observation_id":"b44d1d2f-d7dd-492f-ac60-379d5e772c64","resolution":{"observed_at":"2026-05-12T09:04:34.870188Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-30T19:25:31.081761+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-30T19:25:31.081761+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10781","last_updated":"2025-03-02T14:37:53Z","snapshot_observed_at":"2026-08-02T20:46:05.666977Z","submitted_at":"2024-10-14T17:50:28Z","title":"When Attention Sink Emerges in Language Models: An Empirical View","version":2},"cited_work":{"arxiv_id":"2410.10781","doi":"10.48550/arxiv.2410.10781","metadata_source":"pith","pith_arxiv_id":"2410.10781","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When Attention Sink Emerges in Language Models: An Empirical View","venue":"cs.CL","work_id":"ab480e70-3517-4875-81ef-6cc6fa6db46d","year":2024},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2410.10781","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:b9fccd605be4598e7bdc65281313e5d69ae53f36f781c9dec4e42292aa50594c","observation_id":"de9a4bb3-5fb6-436a-8f8b-80e4143c84eb","resolution":{"observed_at":"2026-05-16T17:41:03.919229Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:02ad89afb60bfd66ecda0e2ebe0d29044636b863b1372a3910df3ca76bd35b87","observation_id":"05b93118-90e1-483c-89b1-40af340288df","resolution":{"observed_at":"2026-05-12T09:04:34.877515Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:e49ef989d1e676a8185a0e5b08f6fb708e0b47146d4c3ff3c7f4ddf0790e8a36","observation_id":"a1ccb3e3-005f-4567-bd79-499455a8460d","resolution":{"observed_at":"2026-05-12T09:04:34.881436Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformerqualityinlineartime","venue":null,"work_id":"4f42c242-3bb1-4dae-85ed-297778a2a7c8","year":2022},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:9be4f1142e7ff41736dc600ae0b6936bf36a40b91d8f3fd56c2aa46435efb702","observation_id":"c3ed7834-f983-4826-bc1a-3e73dfe4c419","resolution":{"observed_at":"2026-05-12T09:04:34.964287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:aa0983abafe4bad4b9cab54d5960d3ef757ea565470ddd06dbeb6553fc7448a5","observation_id":"a6cc82a0-b045-4130-9a71-655fe31388d5","resolution":{"observed_at":"2026-05-16T06:26:38.921226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02130","last_updated":"2025-03-31T19:41:52Z","snapshot_observed_at":"2026-08-06T03:12:34.774417Z","submitted_at":"2025-03-03T23:35:23Z","title":"Forgetting Transformer: Softmax Attention with a Forget Gate","version":2},"cited_work":{"arxiv_id":"2503.02130","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.02130","snapshot_observed_at":"2026-07-04T03:29:30.170846Z","title":"Forgetting transformer: Softmax attention with a forget gate","venue":null,"work_id":"cc5197b5-1a1c-48c6-a2b9-498e8ac867ce","year":2025},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2503.02130","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:3ea32ee3aaca19c69672c3659a93bb8bbf0f6c9ef0996adfd6f8ae22c21e64ff","observation_id":"24b7b178-4ab5-4b8d-aec8-1aa39c8c63bd","resolution":{"observed_at":"2026-05-12T09:04:34.889061Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06162","last_updated":"2018-12-14T20:49:09Z","snapshot_observed_at":"2026-07-06T07:21:19.842962Z","submitted_at":"2018-12-14T20:49:09Z","title":"An Empirical Model of Large-Batch Training","version":1},"cited_work":{"arxiv_id":"1812.06162","doi":"10.48550/arxiv.1812.06162","metadata_source":"pith","pith_arxiv_id":"1812.06162","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Empirical Model of Large-Batch Training","venue":"cs.LG","work_id":"f3989b96-1ee9-403f-a0e2-0342ac16bcb7","year":2018},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/1812.06162","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:5041627aa2a484398c1b267aa5b004975c5a404838df4d1217b53682238cb7c8","observation_id":"bd67d55e-370b-4374-8d24-76414fd3706a","resolution":{"observed_at":"2026-05-12T09:04:34.893990Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1402.1869","last_updated":"2014-06-07T19:56:14Z","snapshot_observed_at":"2026-07-06T03:35:28.758073Z","submitted_at":"2014-02-08T17:16:27Z","title":"On the Number of Linear Regions of Deep Neural Networks","version":2},"cited_work":{"arxiv_id":"1402.1869","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1402.1869","snapshot_observed_at":"2026-07-04T18:57:14.932026Z","title":"On the Number of Linear Regions of Deep Neural Networks.arXiv2014","venue":null,"work_id":"fc744326-5729-4f52-afd7-a4cfd137c7a8","year":null},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/1402.1869","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:24502e0808e98ad699391bfebf789d72be471f92ce9aef5fae84e8d560852fef","observation_id":"efaeabb2-500c-4141-864c-d9fbe3185454","resolution":{"observed_at":"2026-07-04T18:57:14.932026Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00071","last_updated":"2026-02-06T19:40:50Z","snapshot_observed_at":"2026-08-01T02:15:47.181936Z","submitted_at":"2023-08-31T18:18:07Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","version":3},"cited_work":{"arxiv_id":"2309.00071","doi":"10.48550/arxiv.2309.00071","metadata_source":"pith","pith_arxiv_id":"2309.00071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","venue":"cs.CL","work_id":"31f454a9-7de2-4696-86f2-9bfa1410f80d","year":2023},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2309.00071","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:5eb70c98b2057a4e4d82ca943e828685315a4ee1c5cfd2ad0b8025143e5681cd","observation_id":"3c35a7ac-f334-4fdf-9dd6-065b7503fd47","resolution":{"observed_at":"2026-05-12T09:04:34.900598Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-07-06T21:17:23.576970Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"cited_work":{"arxiv_id":"2505.00315","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00315","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","venue":null,"work_id":"2657c7cd-bbb5-44d4-8e0d-e5f8895c155f","year":2025},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2505.00315","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:8821c2d6f2e757316ed56d67ae0ff25a2e766372ba8bb1ab98d0d1a99fb56850","observation_id":"0f65d681-9848-4316-9905-dd2d8b9b35f1","resolution":{"observed_at":"2026-05-12T09:04:34.904141Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11873","last_updated":"2025-02-04T02:07:37Z","snapshot_observed_at":"2026-07-06T20:23:40.374376Z","submitted_at":"2025-01-21T04:04:39Z","title":"Demons in the Detail: On Implementing Load Balancing Loss for Training Specialized Mixture-of-Expert Models","version":2},"cited_work":{"arxiv_id":"2501.11873","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.11873","snapshot_observed_at":"2026-07-04T06:29:38.231668Z","title":"Demons in the detail: On implementing load balancing loss for training specialized mixture-of-expert models, 2025 a","venue":null,"work_id":"1625236e-e6d2-4e4d-bc26-db51815098e7","year":2025},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2501.11873","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:5724e115e4d8d5217ab11743692668885f07553785352c3be90c6e5176f21e40","observation_id":"e8f5c733-853d-4c28-a2db-c92d08ce8e6e","resolution":{"observed_at":"2026-05-12T09:04:34.915567Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":"2002.05202","doi":"10.48550/arxiv.2002.05202","metadata_source":"pith","pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLU Variants Improve Transformer","venue":"cs.LG","work_id":"17d0763c-1016-41ab-a478-478e890765eb","year":2020},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:ef260c0f03eac5640d02899559fac74fe64573e581d09268f39322db88c59171","observation_id":"05dd7250-bd48-4eef-a839-f1e487a147dd","resolution":{"observed_at":"2026-05-12T09:04:34.919777Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:07.002485+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:07.002485+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1505.00387","last_updated":"2015-11-03T18:15:15Z","snapshot_observed_at":"2026-07-06T04:16:46.012738Z","submitted_at":"2015-05-03T01:56:57Z","title":"Highway Networks","version":2},"cited_work":{"arxiv_id":"1505.00387","doi":"10.48550/arxiv.1505.00387","metadata_source":"pith","pith_arxiv_id":"1505.00387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Highway Networks","venue":"cs.LG","work_id":"2ba1e9bc-bbb7-470f-aba1-b4bf4d7a88c5","year":2015},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/1505.00387","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:d9a3934ef00eba19775db682405f0653322743c62ea5f0bc416de2bfee8cf7a2","observation_id":"7cbaa56c-e684-4749-a761-579a18b95362","resolution":{"observed_at":"2026-05-12T09:04:34.923850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:23.483436+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:23.483436+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:75b88919f766307ccac76142aa781401f787e642564b4eff18d69fe4cb9625d3","observation_id":"8d42df7f-ea28-419d-9a80-f2464a4d062b","resolution":{"observed_at":"2026-05-16T07:02:54.298502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":"2307.08621","doi":"10.48550/arxiv.2307.08621","metadata_source":"pith","pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","venue":"cs.CL","work_id":"5b0449ac-92b0-41f2-8b4f-586c2b5a08b6","year":2023},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:9c92cff2ac47f50f4cbe072811138580a346806111e323ff45d57b837d587008","observation_id":"79e76366-d832-4e86-9e1c-289ba9e8afab","resolution":{"observed_at":"2026-05-12T09:04:34.930845Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.09418","last_updated":"2019-06-07T14:00:58Z","snapshot_observed_at":"2026-08-01T19:51:24.042109Z","submitted_at":"2019-05-23T01:13:24Z","title":"Analyzing Multi-Head Self-Attention: Specialized Heads Do the Heavy Lifting, the Rest Can Be Pruned","version":2},"cited_work":{"arxiv_id":"1905.09418","doi":"10.48550/arxiv.1905.09418","metadata_source":"pith","pith_arxiv_id":"1905.09418","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Analyzing Multi-Head Self-Attention: Specialized Heads Do the Heavy Lifting, the Rest Can Be Pruned","venue":"cs.CL","work_id":"fe47c603-f552-4546-8799-18d3072f4725","year":2019},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/1905.09418","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:8a932386ddb2090da9e03b11ffe49399f5edadebb293ba9fcd4a95ea79404a32","observation_id":"a5a9bf81-705b-4e08-9e2b-4520bd8542ea","resolution":{"observed_at":"2026-05-12T09:04:34.934454Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00555","last_updated":"2022-03-01T15:36:38Z","snapshot_observed_at":"2026-08-07T12:15:22.242632Z","submitted_at":"2022-03-01T15:36:38Z","title":"DeepNet: Scaling Transformers to 1,000 Layers","version":1},"cited_work":{"arxiv_id":"2203.00555","doi":"10.48550/arxiv.2203.00555","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.00555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Xiong, R., Yang, Y ., He, D., Zheng, K., Zheng, S., Xing, C., Zhang, H., Lan, Y ., Wang, L., and Liu, T.-Y","venue":"arXiv (Cornell University)","work_id":"80d58e2d-841f-4d87-a1b6-a2b5c105498a","year":2022},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2203.00555","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:f9c61ee22ed5f481f0944a793d3f4e9cb1c5136308174bd084272767f43192b5","observation_id":"a1019b78-1466-4b3d-8e4a-39007fabba98","resolution":{"observed_at":"2026-05-12T09:04:34.938109Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":"2309.17453","doi":"10.48550/arxiv.2309.17453","metadata_source":"pith","pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Streaming Language Models with Attention Sinks","venue":"cs.CL","work_id":"a8d25452-c237-48c9-88a4-682717c3979a","year":2023},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:e0318a2d3e078bb1db9c028ced2be028184aa1bf996c16a960b8fbed406395c7","observation_id":"81502e10-2afe-45ec-94b5-d4e3cb6b6a60","resolution":{"observed_at":"2026-05-12T09:04:34.942755Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:f6cda58157d62ccec4007527ecdb30a27c7846fc604a7d8c38e64da972cf8bfa","observation_id":"4a79c627-7562-4cf6-8414-0a901aaa0ed2","resolution":{"observed_at":"2026-05-12T09:04:34.945837Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08908","last_updated":"2025-03-11T21:40:58Z","snapshot_observed_at":"2026-07-06T20:51:00.484104Z","submitted_at":"2025-03-11T21:40:58Z","title":"Interpreting the Repeated Token Phenomenon in Large Language Models","version":1},"cited_work":{"arxiv_id":"2503.08908","doi":"10.48550/arxiv.2503.08908","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.08908","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpreting the repeated token phenomenon in large language models","venue":"ArXiv.org","work_id":"fc239628-95fe-4a36-9abe-a8991cc67c74","year":2025},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2503.08908","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:2ae21937772373332b5a06e242d2e154041165ca9f95482e6a20693ddf4eb752","observation_id":"d78de024-8941-40d9-92e2-15d09c2c8a94","resolution":{"observed_at":"2026-05-12T09:04:34.949399Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11089","last_updated":"2025-02-27T09:01:21Z","snapshot_observed_at":"2026-08-07T14:17:15.942844Z","submitted_at":"2025-02-16T11:53:44Z","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","version":2},"cited_work":{"arxiv_id":"2502.11089","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11089","snapshot_observed_at":"2026-07-10T01:36:44.142264Z","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","venue":"cs.CL","work_id":"c74d35ec-94d3-48f5-a291-20cfad7c04a3","year":2025},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2502.11089","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:3d0b5233d00ea545d9f71399b98eea96804f479c3d0fb9ed2964fe6d4883b5e0","observation_id":"3604fff3-b87e-4ea7-8b33-de05a245e1d4","resolution":{"observed_at":"2026-05-16T23:46:30.294205Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":"1905.07830","doi":"10.48550/arxiv.1905.07830","metadata_source":"pith","pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","venue":"cs.CL","work_id":"79f44c0c-96f4-4edb-bc50-a3c9d6b85936","year":2019},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:a57c0d8e1811616c1f3ff5d85b38172b8d4b529c2c5e6b7a5757d27060842129","observation_id":"dc9c4237-363d-4e59-bee0-a771280720a9","resolution":{"observed_at":"2026-05-12T09:04:34.956066Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02414","last_updated":"2023-10-25T05:22:43Z","snapshot_observed_at":"2026-08-02T04:26:53.194797Z","submitted_at":"2022-10-05T17:34:44Z","title":"GLM-130B: An Open Bilingual Pre-trained Model","version":2},"cited_work":{"arxiv_id":"2210.02414","doi":"10.48550/arxiv.2210.02414","metadata_source":"pith","pith_arxiv_id":"2210.02414","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLM-130B: An Open Bilingual Pre-trained Model","venue":"cs.CL","work_id":"b6ef9427-af31-4c7c-8c34-bee621978c23","year":2022},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2210.02414","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:00911b3863f5d53d319a0025fe12f7f0b47f0d2830dc53bdab252c9c94519502","observation_id":"76bb52cf-5d11-492c-ae4e-e61290ed09c5","resolution":{"observed_at":"2026-05-14T17:41:34.452877Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:7871852a68b2a5f7f0aaded0a654c8525f76b5b5dd43c9678259610c38bb7600","observation_id":"8e8d7945-0255-4df4-9709-245e1884b6a1","resolution":{"observed_at":"2026-05-12T23:14:26.471193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20966","last_updated":"2026-04-17T09:56:07Z","snapshot_observed_at":"2026-07-06T21:16:36.894196Z","submitted_at":"2025-04-29T17:36:18Z","title":"Softpick: No Attention Sink, No Massive Activations with Rectified Softmax","version":4},"cited_work":{"arxiv_id":"2504.20966","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.20966","snapshot_observed_at":"2026-06-29T08:23:15.622080Z","title":"Softpick: No Attention Sink, No Massive Activations with Rectified Softmax","venue":"cs.LG","work_id":"94b1ae96-600a-44e3-9fb8-c3ac26d1ca0e","year":2025},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2504.20966","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:0f202f5a3e2e3e9c9c7e66b4623ebabd57a0787e7333be99f029dbb3555bc02f","observation_id":"51a088e9-3839-42ae-b99a-df800b24805a","resolution":{"observed_at":"2026-05-12T09:04:34.829561Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":10,"parse_uncertain":0,"unresolved":0,"verified_exact":23,"verified_fuzzy":2},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 89 inbound Pith citation observations for arXiv:2505.06708."}