{"as_of":"2026-08-04T14:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2d9a254fe61608450fc58c7253f7a59685147a6b2c0e761015ef1daf7b4fd40a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T05:50:25.905992Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-06-29T08:23:15.622080Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.20966","last_updated":"2026-04-17T09:56:07Z","snapshot_observed_at":"2026-07-06T21:16:36.894196Z","submitted_at":"2025-04-29T17:36:18Z","title":"Softpick: No Attention Sink, No Massive Activations with Rectified Softmax","version":4},"cited_work":{"arxiv_id":"2504.20966","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.20966","snapshot_observed_at":"2026-06-29T08:23:15.622080Z","title":"Softpick: No Attention Sink, No Massive Activations with Rectified Softmax","venue":"cs.LG","work_id":"94b1ae96-600a-44e3-9fb8-c3ac26d1ca0e","year":2025},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2504.20966","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:57faa61303d82a88fd48b25c33e4c126af1c857c9c604fac0d839403ac083c5c","observation_id":"51a088e9-3839-42ae-b99a-df800b24805a","resolution":{"observed_at":"2026-05-12T09:04:34.829561Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20966","last_updated":"2026-04-17T09:56:07Z","snapshot_observed_at":"2026-07-06T21:16:36.894196Z","submitted_at":"2025-04-29T17:36:18Z","title":"Softpick: No Attention Sink, No Massive Activations with Rectified Softmax","version":4},"cited_work":{"arxiv_id":"2504.20966","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.20966","snapshot_observed_at":"2026-06-29T08:23:15.622080Z","title":"Softpick: No Attention Sink, No Massive Activations with Rectified Softmax","venue":"cs.LG","work_id":"94b1ae96-600a-44e3-9fb8-c3ac26d1ca0e","year":2025},"citing_paper":{"arxiv_id":"2602.01203","last_updated":"2026-05-27T09:56:04Z","snapshot_observed_at":"2026-08-03T05:50:12.776797Z","submitted_at":"2026-02-01T12:45:39Z","title":"Attention Sink Forges Native MoE in Attention Layers: Sink-Aware Training to Address Head Collapse","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T08:47:29.236561Z"},"links":{"cited_paper":"/paper/2504.20966","citing_paper":"/paper/2602.01203"},"observation_digest":"sha256:6333b2d57be75357fa4e9f4ab87c208412116d58b78eddfeaf9819bb00a7663e","observation_id":"e5eecf65-ba09-4cc8-b435-1164e311c6c7","resolution":{"observed_at":"2026-05-16T08:47:37.236481Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20966","last_updated":"2026-04-17T09:56:07Z","snapshot_observed_at":"2026-07-06T21:16:36.894196Z","submitted_at":"2025-04-29T17:36:18Z","title":"Softpick: No Attention Sink, No Massive Activations with Rectified Softmax","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20966","snapshot_observed_at":"2026-08-03T05:50:25.905992Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.01203","last_updated":"2026-05-27T09:56:04Z","snapshot_observed_at":"2026-08-03T05:50:12.776797Z","submitted_at":"2026-02-01T12:45:39Z","title":"Attention Sink Forges Native MoE in Attention Layers: Sink-Aware Training to Address Head Collapse","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T05:50:25.905992Z"},"links":{"cited_paper":"/paper/2504.20966","citing_paper":"/paper/2602.01203"},"observation_digest":"sha256:7b1554acd68c6a95eef5d793f97585871a7d9003f8abd36f4349828f1d0d326f","observation_id":"76878d18-181b-4c31-9292-092af760ca6a","resolution":{"observed_at":"2026-08-03T05:50:25.905992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20966","last_updated":"2026-04-17T09:56:07Z","snapshot_observed_at":"2026-07-06T21:16:36.894196Z","submitted_at":"2025-04-29T17:36:18Z","title":"Softpick: No Attention Sink, No Massive Activations with Rectified Softmax","version":4},"cited_work":{"arxiv_id":"2504.20966","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.20966","snapshot_observed_at":"2026-06-29T08:23:15.622080Z","title":"Softpick: No Attention Sink, No Massive Activations with Rectified Softmax","venue":"cs.LG","work_id":"94b1ae96-600a-44e3-9fb8-c3ac26d1ca0e","year":2025},"citing_paper":{"arxiv_id":"2603.17771","last_updated":"2026-05-06T02:55:53Z","snapshot_observed_at":"2026-07-06T22:49:33.482934Z","submitted_at":"2026-03-18T14:31:21Z","title":"Attention Sinks Induce Gradient Sinks: Massive Activations as Gradient Regulators in Transformers","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-15T09:33:45.259455Z"},"links":{"cited_paper":"/paper/2504.20966","citing_paper":"/paper/2603.17771"},"observation_digest":"sha256:d6e04778b69ee3883c94858c398275dda94736644719a7f013e694f5366f5cee","observation_id":"bc43e462-537f-4ce7-9475-27487d18bbfa","resolution":{"observed_at":"2026-05-15T09:35:22.453752Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20966","last_updated":"2026-04-17T09:56:07Z","snapshot_observed_at":"2026-07-06T21:16:36.894196Z","submitted_at":"2025-04-29T17:36:18Z","title":"Softpick: No Attention Sink, No Massive Activations with Rectified Softmax","version":4},"cited_work":{"arxiv_id":"2504.20966","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.20966","snapshot_observed_at":"2026-06-29T08:23:15.622080Z","title":"Softpick: No Attention Sink, No Massive Activations with Rectified Softmax","venue":"cs.LG","work_id":"94b1ae96-600a-44e3-9fb8-c3ac26d1ca0e","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"cited_paper":"/paper/2504.20966","citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:1f5f60d6a26777a65eaa3026d7a1299a75ae1062c85b72d99664bca5037bdf1b","observation_id":"1639b654-9aab-48e4-bd4f-b3999b366418","resolution":{"observed_at":"2026-05-11T09:05:58.105206Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20966","last_updated":"2026-04-17T09:56:07Z","snapshot_observed_at":"2026-07-06T21:16:36.894196Z","submitted_at":"2025-04-29T17:36:18Z","title":"Softpick: No Attention Sink, No Massive Activations with Rectified Softmax","version":4},"cited_work":{"arxiv_id":"2504.20966","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.20966","snapshot_observed_at":"2026-06-29T08:23:15.622080Z","title":"Softpick: No Attention Sink, No Massive Activations with Rectified Softmax","venue":"cs.LG","work_id":"94b1ae96-600a-44e3-9fb8-c3ac26d1ca0e","year":2025},"citing_paper":{"arxiv_id":"2605.04421","last_updated":"2026-05-06T02:27:25Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:27:25Z","title":"FLUID: Continuous-Time Hyperconnected Sparse Transformer for Sink-Free Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T17:39:25.534863Z"},"links":{"cited_paper":"/paper/2504.20966","citing_paper":"/paper/2605.04421"},"observation_digest":"sha256:ac37cc2c6f07a256032ccb2e96cef03b58a785cb3024e841033239182ee99557","observation_id":"0b940071-93a4-4772-8f29-65fc64ccfe17","resolution":{"observed_at":"2026-05-11T17:21:09.954492Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20966","last_updated":"2026-04-17T09:56:07Z","snapshot_observed_at":"2026-07-06T21:16:36.894196Z","submitted_at":"2025-04-29T17:36:18Z","title":"Softpick: No Attention Sink, No Massive Activations with Rectified Softmax","version":4},"cited_work":{"arxiv_id":"2504.20966","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.20966","snapshot_observed_at":"2026-06-29T08:23:15.622080Z","title":"Softpick: No Attention Sink, No Massive Activations with Rectified Softmax","venue":"cs.LG","work_id":"94b1ae96-600a-44e3-9fb8-c3ac26d1ca0e","year":2025},"citing_paper":{"arxiv_id":"2605.08504","last_updated":"2026-05-12T18:33:07Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T21:37:27Z","title":"A Single Layer to Explain Them All:Understanding Massive Activations in Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T02:29:20.796512Z"},"links":{"cited_paper":"/paper/2504.20966","citing_paper":"/paper/2605.08504"},"observation_digest":"sha256:a83bc7071e463a68b20d83b5b4932e5eb8d409cffd7ed859a554e7eb53c5c6a5","observation_id":"6c0f6fdb-5e5e-4dca-afc5-08a1b296bf19","resolution":{"observed_at":"2026-05-12T07:36:41.426279Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20966","last_updated":"2026-04-17T09:56:07Z","snapshot_observed_at":"2026-07-06T21:16:36.894196Z","submitted_at":"2025-04-29T17:36:18Z","title":"Softpick: No Attention Sink, No Massive Activations with Rectified Softmax","version":4},"cited_work":{"arxiv_id":"2504.20966","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.20966","snapshot_observed_at":"2026-06-29T08:23:15.622080Z","title":"Softpick: No Attention Sink, No Massive Activations with Rectified Softmax","venue":"cs.LG","work_id":"94b1ae96-600a-44e3-9fb8-c3ac26d1ca0e","year":2025},"citing_paper":{"arxiv_id":"2605.08504","last_updated":"2026-05-12T18:33:07Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T21:37:27Z","title":"A Single Layer to Explain Them All:Understanding Massive Activations in Large Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-14T21:03:25.624300Z"},"links":{"cited_paper":"/paper/2504.20966","citing_paper":"/paper/2605.08504"},"observation_digest":"sha256:38b51fad36b3a8f28dab8e082abfbbf1844591619f7c93aae44e24c780a09f77","observation_id":"07a12766-33dd-480c-9d6c-4a69d7802684","resolution":{"observed_at":"2026-05-14T21:19:29.078717Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20966","last_updated":"2026-04-17T09:56:07Z","snapshot_observed_at":"2026-07-06T21:16:36.894196Z","submitted_at":"2025-04-29T17:36:18Z","title":"Softpick: No Attention Sink, No Massive Activations with Rectified Softmax","version":4},"cited_work":{"arxiv_id":"2504.20966","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.20966","snapshot_observed_at":"2026-06-29T08:23:15.622080Z","title":"Softpick: No Attention Sink, No Massive Activations with Rectified Softmax","venue":"cs.LG","work_id":"94b1ae96-600a-44e3-9fb8-c3ac26d1ca0e","year":2025},"citing_paper":{"arxiv_id":"2605.17887","last_updated":"2026-05-18T05:53:09Z","snapshot_observed_at":"2026-07-06T23:28:50.117638Z","submitted_at":"2026-05-18T05:53:09Z","title":"Attention Sinks and Outliers in Attention Residuals","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T12:12:20.271730Z"},"links":{"cited_paper":"/paper/2504.20966","citing_paper":"/paper/2605.17887"},"observation_digest":"sha256:7be0bb48091c9ba1367e6c262e3d7ca341dc3a859079dd90ead294b33120f6c2","observation_id":"d7f6adae-a93d-4835-9983-de9431a3a23a","resolution":{"observed_at":"2026-05-20T12:13:16.040745Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20966","last_updated":"2026-04-17T09:56:07Z","snapshot_observed_at":"2026-07-06T21:16:36.894196Z","submitted_at":"2025-04-29T17:36:18Z","title":"Softpick: No Attention Sink, No Massive Activations with Rectified Softmax","version":4},"cited_work":{"arxiv_id":"2504.20966","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.20966","snapshot_observed_at":"2026-06-29T08:23:15.622080Z","title":"Softpick: No Attention Sink, No Massive Activations with Rectified Softmax","venue":"cs.LG","work_id":"94b1ae96-600a-44e3-9fb8-c3ac26d1ca0e","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-02T21:06:34.067413Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2504.20966","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:5690255d398aaad7925730e86b813681925a16cedddee789cab97b7b931bbb35","observation_id":"6cb40198-ed7b-470f-adce-4f181def8767","resolution":{"observed_at":"2026-05-20T07:58:07.603107Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20966","last_updated":"2026-04-17T09:56:07Z","snapshot_observed_at":"2026-07-06T21:16:36.894196Z","submitted_at":"2025-04-29T17:36:18Z","title":"Softpick: No Attention Sink, No Massive Activations with Rectified Softmax","version":4},"cited_work":{"arxiv_id":"2504.20966","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.20966","snapshot_observed_at":"2026-06-29T08:23:15.622080Z","title":"Softpick: No Attention Sink, No Massive Activations with Rectified Softmax","venue":"cs.LG","work_id":"94b1ae96-600a-44e3-9fb8-c3ac26d1ca0e","year":2025},"citing_paper":{"arxiv_id":"2605.20798","last_updated":"2026-05-20T06:43:34Z","snapshot_observed_at":"2026-08-02T17:01:43.729235Z","submitted_at":"2026-05-20T06:43:34Z","title":"Most Transformer Modifications Still Do Not Transfer at 1-3B: A 2020-2026 Update to Narang et al. (2021) with Downstream Evaluation and a Noise Floor","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-21T06:15:47.451870Z"},"links":{"cited_paper":"/paper/2504.20966","citing_paper":"/paper/2605.20798"},"observation_digest":"sha256:db9edc34141f6f75f307a25519543cdc350ce0c5a65f055c72a53022166980be","observation_id":"bda6fcf9-4e72-45fa-aac9-e892414412e3","resolution":{"observed_at":"2026-05-21T06:19:42.075085Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20966","last_updated":"2026-04-17T09:56:07Z","snapshot_observed_at":"2026-07-06T21:16:36.894196Z","submitted_at":"2025-04-29T17:36:18Z","title":"Softpick: No Attention Sink, No Massive Activations with Rectified Softmax","version":4},"cited_work":{"arxiv_id":"2504.20966","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.20966","snapshot_observed_at":"2026-06-29T08:23:15.622080Z","title":"Softpick: No Attention Sink, No Massive Activations with Rectified Softmax","venue":"cs.LG","work_id":"94b1ae96-600a-44e3-9fb8-c3ac26d1ca0e","year":2025},"citing_paper":{"arxiv_id":"2605.30010","last_updated":"2026-05-28T14:36:44Z","snapshot_observed_at":"2026-08-02T23:58:30.012302Z","submitted_at":"2026-05-28T14:36:44Z","title":"EarlyTom: Early Token Compression Completes Fast Video Understanding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-29T08:16:02.536341Z"},"links":{"cited_paper":"/paper/2504.20966","citing_paper":"/paper/2605.30010"},"observation_digest":"sha256:23743642bb1d826765db4f27a074cae9f46270d5dd65e5a398b26d2d213c3722","observation_id":"18e57d34-480f-4e1e-a4cc-aaed0ed370b6","resolution":{"observed_at":"2026-06-29T08:23:15.623304Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20966","last_updated":"2026-04-17T09:56:07Z","snapshot_observed_at":"2026-07-06T21:16:36.894196Z","submitted_at":"2025-04-29T17:36:18Z","title":"Softpick: No Attention Sink, No Massive Activations with Rectified Softmax","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20966","snapshot_observed_at":"2026-07-31T23:19:56.727294Z","title":"Is there a {object} in the image?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24017","last_updated":"2026-07-27T05:30:19Z","snapshot_observed_at":"2026-08-03T09:11:16.165986Z","submitted_at":"2026-07-27T05:30:19Z","title":"Disentangling Semantic Attention from Structural Bias in the Attention Manifold","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T23:19:56.727294Z"},"links":{"cited_paper":"/paper/2504.20966","citing_paper":"/paper/2607.24017"},"observation_digest":"sha256:dd14a328292db221873598b70e1286210da4b5647744c088a351867565017a99","observation_id":"ae5a6af0-ccec-41c8-99a8-962d15077477","resolution":{"observed_at":"2026-07-31T23:19:56.727294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.20966/citation-record","integrity":"/paper/2504.20966/integrity","json":"/paper/2504.20966/citation-record.json","paper":"/paper/2504.20966"},"outbound":[],"paper":{"arxiv_id":"2504.20966","last_updated":"2026-04-17T09:56:07Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T21:16:36.894196Z","submitted_at":"2025-04-29T17:36:18Z","title":"Softpick: No Attention Sink, No Massive Activations with Rectified Softmax"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 13 inbound Pith citation observations for arXiv:2504.20966."}