{"as_of":"2026-08-08T15:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ba46332c1e69c6ded557e4538d7d68a7b095dcf4e128d1ec2294a6040e6ad930","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:24:50.181009Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T11:31:29.345098Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T23:23:26.799225Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16018","snapshot_observed_at":"2026-08-04T11:31:29.345098Z","title":"Artifacts and attention sinks: Structured ap- proximations for efficient vision transformers.arXiv preprint arXiv:2507.16018, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.04547","last_updated":"2026-07-08T06:28:12Z","snapshot_observed_at":"2026-08-05T18:52:45.747562Z","submitted_at":"2025-10-06T07:27:46Z","title":"Activation Quantization of Vision Encoders Needs Prefixing Registers","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T11:31:29.345098Z"},"links":{"cited_paper":"/paper/2507.16018","citing_paper":"/paper/2510.04547"},"observation_digest":"sha256:b67db4933efaa97bd7bc851b8b8ca5d0d30f3444d6118f5b5918f6e62148bc16","observation_id":"ffe15873-87bf-4702-baf9-177afbc04be7","resolution":{"observed_at":"2026-08-04T11:31:29.345098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"cited_work":{"arxiv_id":"2507.16018","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.16018","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2507.16018 (2025)","venue":null,"work_id":"42643698-bb06-41d7-926e-45ae4f3b62ea","year":2025},"citing_paper":{"arxiv_id":"2604.03316","last_updated":"2026-07-26T08:57:51Z","snapshot_observed_at":"2026-08-02T17:55:36.175897Z","submitted_at":"2026-04-01T09:59:09Z","title":"When Sinks Help or Hurt: Unified Framework for Attention Sink in Large Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T23:20:51.899127Z"},"links":{"cited_paper":"/paper/2507.16018","citing_paper":"/paper/2604.03316"},"observation_digest":"sha256:8e77b711835e345cf775d8de493a43b5f064673acd8f3a42b9cd28a3bca52a52","observation_id":"c252b151-162f-490a-bf6d-061575cd5cdd","resolution":{"observed_at":"2026-05-13T23:23:26.802375Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16018","snapshot_observed_at":"2026-08-02T17:04:23.629886Z","title":"arXiv preprint arXiv:2507.16018 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03316","last_updated":"2026-07-26T08:57:51Z","snapshot_observed_at":"2026-08-02T17:55:36.175897Z","submitted_at":"2026-04-01T09:59:09Z","title":"When Sinks Help or Hurt: Unified Framework for Attention Sink in Large Vision-Language Models","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T17:04:23.629886Z"},"links":{"cited_paper":"/paper/2507.16018","citing_paper":"/paper/2604.03316"},"observation_digest":"sha256:69b50f2c66bbe6a462fbc3a83964bdcce7eba3e7d124aef19e9c5e270791eebf","observation_id":"d4627e67-aaac-41e0-b9f0-59d339972536","resolution":{"observed_at":"2026-08-02T17:04:23.629886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"cited_work":{"arxiv_id":"2507.16018","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.16018","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2507.16018 (2025)","venue":null,"work_id":"42643698-bb06-41d7-926e-45ae4f3b62ea","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":119,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"cited_paper":"/paper/2507.16018","citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:b013d691b251843e5412a540409709845002a685754e9ae9d2fde2086b943871","observation_id":"456fdfc1-d921-4322-a70a-677943c8e9c7","resolution":{"observed_at":"2026-05-11T09:05:57.868852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"cited_work":{"arxiv_id":"2507.16018","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.16018","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2507.16018 (2025)","venue":null,"work_id":"42643698-bb06-41d7-926e-45ae4f3b62ea","year":2025},"citing_paper":{"arxiv_id":"2604.20937","last_updated":"2026-06-19T12:00:35Z","snapshot_observed_at":"2026-08-02T23:37:34.955988Z","submitted_at":"2026-04-22T13:28:53Z","title":"Sink-Token-Aware Pruning for Fine-Grained Video Understanding in Efficient Video LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T00:43:44.921189Z"},"links":{"cited_paper":"/paper/2507.16018","citing_paper":"/paper/2604.20937"},"observation_digest":"sha256:9090035d7a4f9d52da0c98b8052a4d7cda36286697d05b8919af7e3a39596df9","observation_id":"dd8b77d6-729c-4f1e-bca1-40861b5c57ad","resolution":{"observed_at":"2026-05-10T00:49:48.965225Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.16018/citation-record","integrity":"/paper/2507.16018/integrity","json":"/paper/2507.16018/citation-record.json","paper":"/paper/2507.16018"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:54.342010Z","title":"Lawrence Zitnick, Dhruv Batra, and Devi Parikh","venue":null,"work_id":"403cd393-a1c4-44c1-89f0-a83fbb5d8e64","year":2015},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:47.498881Z"},"links":{"citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:92e7a01fe1e2cd2247b854786555478bdc73a775173927226988a0222be1e144","observation_id":"c981a6ee-6035-4c34-95e1-a5d869e5675f","resolution":{"observed_at":"2026-08-06T15:24:54.411510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-06T15:24:47.535550Z","title":"Peters, and Arman Cohan","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:47.535550Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:8dc527533ab993486a1ee882b0e97906fb0248665963287533282e60df235655","observation_id":"c14c6a63-cc6d-4ed0-83d1-352d24086854","resolution":{"observed_at":"2026-08-06T15:24:47.535550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:54.254180Z","title":"Lawrence Zitnick","venue":null,"work_id":"890d2e34-895a-40db-b7da-da9b7b65377a","year":2015},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:47.616312Z"},"links":{"citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:40089c0c0dca29418904a587c65ae5c47df3a21ee164ab4f939054d10ecd15d4","observation_id":"76d94c1c-53ae-46cc-9d02-e993d99a2853","resolution":{"observed_at":"2026-08-06T15:24:54.309011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:54.106907Z","title":"Learn- ing a sparse transformer network for effective image deraining","venue":null,"work_id":"5f7eb174-ce5e-4da4-908f-8df096881ccf","year":2023},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:47.694265Z"},"links":{"citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:1f1504f89f4e4a927f62583f8aa241ac8ef454168beb0a0792eef66ce8e8e089","observation_id":"0e377806-5496-4520-a1a4-71771e2303da","resolution":{"observed_at":"2026-08-06T15:24:54.181401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-06T08:05:35.311510Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-06T15:24:47.777832Z","title":"Generating long sequences with sparse transformers","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:47.777832Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:e38850fefe90da0969ce0c1db11668391785f5fe3817b954e8ad45c980da1bd2","observation_id":"82440fe8-d2c7-4a32-97d4-e8fb0ff68fc4","resolution":{"observed_at":"2026-08-06T15:24:47.777832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.14794","last_updated":"2022-11-19T12:45:21Z","snapshot_observed_at":"2026-08-07T11:26:24.987920Z","submitted_at":"2020-09-30T17:09:09Z","title":"Rethinking Attention with Performers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.14794","snapshot_observed_at":"2026-08-06T15:24:47.885413Z","title":"Performer: Linear attention via positive random features","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:47.885413Z"},"links":{"cited_paper":"/paper/2009.14794","citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:357f5852a0c32764966071e5285a07d0a856a0b6f3b2e58e61425f9949b55f3d","observation_id":"c4fe5d49-6dbe-4758-adc6-3e842fb54b4b","resolution":{"observed_at":"2026-08-06T15:24:47.885413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:53.964874Z","title":"Flashattention-2: Faster attention with better paral- lelism and work partitioning","venue":null,"work_id":"61dc8ce3-1427-4213-b8f0-d7234f05e1cf","year":null},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:48.021266Z"},"links":{"citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:6dd73f1f3c5661dd1e6ee9c812be438f0b01ba770ddada0e523f0b9575e0db4e","observation_id":"3d8539d5-1712-44c8-9495-9b5da9ce94b1","resolution":{"observed_at":"2026-08-06T15:24:54.039306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:53.826127Z","title":"Vision transformers need registers","venue":null,"work_id":"ab5b4023-365a-4e7d-80c7-f384893ac265","year":2024},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:48.079236Z"},"links":{"citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:e376b0b6c822be87b49abdbaef837ed48141f95c6b59777205f7f1ad387f8ce1","observation_id":"f4e46d5d-cb87-44f3-a0fd-6530e09718d4","resolution":{"observed_at":"2026-08-06T15:24:53.895352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:53.686517Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"4b4c6117-1885-4409-b7b1-7b2ec422f138","year":2009},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:48.155616Z"},"links":{"citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:617590c242add7621e6eddb65f126443a5b31249d5c3aaaac1779a19f86ff702","observation_id":"150c8d31-39a9-4cba-831e-0ce38a5d6f71","resolution":{"observed_at":"2026-08-06T15:24:53.779021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:53.582998Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"783362eb-f4f4-4858-a39a-67393c317782","year":2021},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:48.260555Z"},"links":{"citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:611f7fb8c4e5177d756ddb8e6903619980b9b5a1e82859598645659a49db3022","observation_id":"793bddf8-87e4-4b3f-9c16-05a14b17e26b","resolution":{"observed_at":"2026-08-06T15:24:53.625408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:53.447875Z","title":"Everingham, L","venue":null,"work_id":"d06c7697-4a33-4b9c-8504-05c187db4cbc","year":2012},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:48.312998Z"},"links":{"citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:09ae6546e02ec5777b9933a32f89011b016fa5fed54a50c85a748bebf65f62ad","observation_id":"2ad29104-935e-477e-b258-f75d9ebaf680","resolution":{"observed_at":"2026-08-06T15:24:53.485717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10781","last_updated":"2025-03-02T14:37:53Z","snapshot_observed_at":"2026-08-02T20:46:05.666977Z","submitted_at":"2024-10-14T17:50:28Z","title":"When Attention Sink Emerges in Language Models: An Empirical View","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10781","snapshot_observed_at":"2026-08-06T15:24:48.407425Z","title":"When attention sink emerges in language models: An empirical view","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:48.407425Z"},"links":{"cited_paper":"/paper/2410.10781","citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:9ee91083e1f766f6c9d0c49f3d300d850a95dcfa180ac66c4691c3e6e0921f75","observation_id":"f4bc3c22-68db-4dce-bba4-3d76c8fb402e","resolution":{"observed_at":"2026-08-06T15:24:48.407425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:53.312176Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"8bf46cb7-c892-41fd-ae83-087048cbac78","year":2022},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:48.476788Z"},"links":{"citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:d9658c3e264a9184d10778cf7e19e0ba7d6b6cc89b4342de5136b899d9979b7b","observation_id":"b810f74d-2605-4076-b8ff-27608eb3370b","resolution":{"observed_at":"2026-08-06T15:24:53.393235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:48.511482Z","title":"Openclip, July","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:48.511482Z"},"links":{"citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:b2cabc928686c03e66e78a89507ce6eba61bc0c1c1f3d2171b53b9a5817bf927","observation_id":"f84d3fdc-0fc4-45e3-a2ed-aa14e6e2ec0b","resolution":{"observed_at":"2026-08-06T15:24:48.511482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:53.040457Z","title":"Visual instruction tuning","venue":null,"work_id":"944ba148-d2fd-4238-a9c7-a752e81da15c","year":2023},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:48.676487Z"},"links":{"citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:0afc8dde7cb5af11ffc45020a760b085399c6963fade48cb4f569306b9dfa234","observation_id":"0fb906ab-391e-419d-8d36-f91f799e927a","resolution":{"observed_at":"2026-08-06T15:24:53.104255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:48.757968Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:48.757968Z"},"links":{"citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:84fd95f9f5f0988fc1bf694180eb0e7c0af94ab9810c3301910166d45ff05721","observation_id":"613d3aa6-1653-40ec-9e92-4314902654a7","resolution":{"observed_at":"2026-08-06T15:24:48.757968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:52.910227Z","title":"Qi, Li Yi, Hao Su, and Leonidas J","venue":null,"work_id":"18102476-d14b-4cea-b310-cf4e7ecf8bbc","year":2017},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:48.808968Z"},"links":{"citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:f23666f551c1758b0b8d65c8b0709974cd3d4af5f77b127e9906d8a695350965","observation_id":"b1f71f80-4a87-488d-b261-d6ae9a161511","resolution":{"observed_at":"2026-08-06T15:24:52.974535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:52.691932Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"38b9da6c-4dcc-4b56-bebc-1cbe53425095","year":2021},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:48.873991Z"},"links":{"citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:89b4cbd25b277e50d647295833107613f3c4334bb6c5a218dff13fe5063f75f4","observation_id":"7407b7d3-f489-4ee7-b2d9-4c200b7c5df0","resolution":{"observed_at":"2026-08-06T15:24:52.812095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:52.505799Z","title":"Combiner: Full attention transformer with sparse computation cost","venue":null,"work_id":"1dbf286a-07b5-41da-8d40-63c9cdd9f7e4","year":2021},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:48.957779Z"},"links":{"citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:0b1b5ee1400758d1471fd9af64dfcdd878ce251dc0cacf723fc20a62df591711","observation_id":"887fc386-b337-404e-a1b3-44e3b952507d","resolution":{"observed_at":"2026-08-06T15:24:52.581440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:52.370099Z","title":"Normalized cuts and image segmentation","venue":null,"work_id":"dddd6f23-63f7-4e2a-bcc8-8142acee5ce4","year":2000},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:49.004221Z"},"links":{"citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:4e1db891dad2603e26da96ad70eada88b22201cc465909daabb9173020a5fdec","observation_id":"3963c518-794f-44fc-b11f-d3ec84744a2d","resolution":{"observed_at":"2026-08-06T15:24:52.419266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-06T15:24:49.076209Z","title":"Zico Kolter, and Zhuang Liu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:49.076209Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:908d3bf60b51e0ca354da89c3dab1b1c74fe88585b8bb937c9c1294157d4c17e","observation_id":"ac939149-f285-4c96-b1e9-8d3269bf9ef8","resolution":{"observed_at":"2026-08-06T15:24:49.076209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:52.218970Z","title":"Deit iii: Re- venge of the vit","venue":null,"work_id":"d5aab154-9444-446c-80da-35ba6f7ff7f8","year":2022},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:49.141093Z"},"links":{"citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:228a75bec789ed983536cb0848d77b59168ffa418b5f386c7d0c3c2cdc8551c6","observation_id":"21acc710-784d-48fa-b769-4fd5bd0481bd","resolution":{"observed_at":"2026-08-06T15:24:52.311329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:52.041142Z","title":"Attention is all you need","venue":null,"work_id":"fe58a582-00db-4f8d-ac05-c3235a8e9f1b","year":null},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:49.166397Z"},"links":{"citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:5ea8e5c099c62f6b6f7e7b118591b00a5ec19aca6b63b96dc605b54bdc2a425a","observation_id":"385fcaf9-528c-493b-9d55-e508ad21057e","resolution":{"observed_at":"2026-08-06T15:24:52.130781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:51.801917Z","title":null,"venue":null,"work_id":"965327d6-c3a5-4b89-ab6e-8ab29c91cecb","year":2020},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:49.276852Z"},"links":{"citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:29db7069770cb3e181ebea8d9450fc5493b9c757d6ad2093375da118c1f2530a","observation_id":"9872199b-3cd0-4ccd-8a77-815bd6cb21b0","resolution":{"observed_at":"2026-08-06T15:24:51.921140Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:51.666409Z","title":"Nys- trömformer: A nyström-based algorithm for approximating self-attention","venue":null,"work_id":"9ed70886-5c95-4da5-a361-245337a4fec6","year":2021},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:49.326929Z"},"links":{"citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:bd7e7b84244a76f668dd04fee6cb35af61a4ab8a07bc342982e9fa3bd17b5b51","observation_id":"373cc9c3-2113-40de-95a3-8ff1148d0194","resolution":{"observed_at":"2026-08-06T15:24:51.731929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:51.538658Z","title":"Ncut apis – nyström normalized cuts py- torch","venue":null,"work_id":"811aeefd-22a4-4e6e-81f6-e3211d0ebb5d","year":2024},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:49.409750Z"},"links":{"citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:6a9118a6af3e572215af88e110ac78b276f7970906e1ea0e1683cd5b3c2dfe02","observation_id":"5c7a5663-dbc3-4728-b65f-e5b8c81fffc6","resolution":{"observed_at":"2026-08-06T15:24:51.605947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:51.402003Z","title":"Emernerf: Emergent spatial-temporal scene decomposition via self-supervision","venue":null,"work_id":"be59a7ea-39c2-49e6-8021-d33cca19f230","year":2024},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:49.479034Z"},"links":{"citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:d2385bad5b628a7e5daf699cfe2b5c05c9701796c838de638483ea730c407f82","observation_id":"20f7a0c2-bf57-496c-ab5e-0708f9753091","resolution":{"observed_at":"2026-08-06T15:24:51.441107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:51.280824Z","title":"Denoising vision transformers","venue":null,"work_id":"c69f140c-a1bd-4378-b09a-4f6fd4b217b4","year":2024},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:49.593586Z"},"links":{"citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:c6ae4f4574fe34b889d66d625470ba51a5f2e9565c355d23cdfff10870b61718","observation_id":"00a7b2e1-645c-4ff7-a5df-c5f357d60d0f","resolution":{"observed_at":"2026-08-06T15:24:51.321203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:51.224976Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descrip- tions","venue":null,"work_id":"d93467a6-0478-437a-bcda-e0f170350859","year":2014},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:49.664905Z"},"links":{"citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:d2de571f550a33da950aaecb8bb5fdb5329f6b15185e20bf212c060f34c1ae82","observation_id":"363ee880-592c-4e6c-a06d-7d8e9cba552a","resolution":{"observed_at":"2026-08-06T15:24:51.245241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07191","last_updated":"2025-07-07T17:42:19Z","snapshot_observed_at":"2026-08-06T02:24:32.331127Z","submitted_at":"2024-11-11T18:05:48Z","title":"The Super Weight in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07191","snapshot_observed_at":"2026-08-06T15:24:49.774027Z","title":"The super weight in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:49.774027Z"},"links":{"cited_paper":"/paper/2411.07191","citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:1bdcd15da8642cde68e017be0065cb64e7f2e30e4a91296e78fd43771dd099b6","observation_id":"67d73a31-db05-4f4b-82d6-838e5459c640","resolution":{"observed_at":"2026-08-06T15:24:49.774027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:51.075064Z","title":"Wein- berger, and Yoav Artzi","venue":null,"work_id":"3fc4598e-e242-4413-8966-527d215977a5","year":2020},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:49.844093Z"},"links":{"citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:32e44232140862fb71c3e1ddc781c5809feca414fb1180aa12a06da0e55f5e7c","observation_id":"cc85da6c-f182-45db-87cb-d829a90742de","resolution":{"observed_at":"2026-08-06T15:24:51.168221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:50.934065Z","title":"Scene parsing through ade20k dataset","venue":null,"work_id":"f0401456-2e51-432f-8b39-9b2a058076c7","year":2017},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:49.945515Z"},"links":{"citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:bb2c94198fa47ab1c692768932118160e534d7c6d7b5172561bec842f5b9e3fb","observation_id":"7b523e6a-2383-4414-b63b-29c76b106f09","resolution":{"observed_at":"2026-08-06T15:24:51.002257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:50.781145Z","title":"Type I sinking set T","venue":null,"work_id":"e78293a5-1437-425a-a623-6ce6403f3aea","year":null},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:50.011959Z"},"links":{"citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:a89414d3a7fab37b5e88c9ff0c59a5cf2994d7dccc5d9000b2571095a1853b78","observation_id":"db33a8c4-b6d7-4610-bc6f-5b7461c750f3","resolution":{"observed_at":"2026-08-06T15:24:50.868207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:50.637281Z","title":null,"venue":null,"work_id":"b513710b-54a2-4bb3-82cf-a600acdce942","year":null},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:50.102435Z"},"links":{"citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:fa206dcf35aefe5c9bd825cce4cc414494325b1babb6383ccd5eb0ef6c6727c7","observation_id":"fd4c1b60-4b93-4812-b25a-67615099b0d3","resolution":{"observed_at":"2026-08-06T15:24:50.729845Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:50.504068Z","title":"retain their place","venue":null,"work_id":"034c7ac1-4c43-4a34-bf12-e05ccaed00aa","year":null},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:50.137255Z"},"links":{"citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:647b6fd8fa1f1765b0be67370f0d1b95ee4fed47be83f521cbea7cf074627f3c","observation_id":"7d222fc5-a037-4081-92c6-45bb6423027d","resolution":{"observed_at":"2026-08-06T15:24:50.567470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:50.360982Z","title":"On the other hand, the attention pattern for any token t‰ t1 is identical to that of Type I sinking","venue":null,"work_id":"a8eedcd0-6e56-4e95-9bb4-e174d81aa766","year":null},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:50.181009Z"},"links":{"citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:02d29b33ae9024edf1a6a41dc8667127fed4e856f6f527e369dce1b4a1dead6d","observation_id":"705759e3-610b-416c-9d8b-c123a02ef1bd","resolution":{"observed_at":"2026-08-06T15:24:50.432531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:53.211395Z","title":null,"venue":null,"work_id":"83e79272-c1b4-4b89-8ae7-e69cfb82b581","year":null},"citing_paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:48.609948Z"},"links":{"citing_paper":"/paper/2507.16018"},"observation_digest":"sha256:c0993519ad44262b65af16d28cc3a4d8f629473d41cee8b87e812123f287f556","observation_id":"0c3405cc-5fc8-482c-8de6-f1d30353fe0c","resolution":{"observed_at":"2026-08-06T15:24:53.262896Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.16018","last_updated":"2025-07-21T19:29:03Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T15:17:56.637485Z","submitted_at":"2025-07-21T19:29:03Z","title":"Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 5 inbound Pith citation observations for arXiv:2507.16018."}