{"as_of":"2026-08-08T08:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c31af1c2bd7153fc9cec0cdfeb6600b76d7606a8dc4d3032ce5aa33535b5890d","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:15:17.887587Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T09:39:39.275110Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11449","snapshot_observed_at":"2026-08-04T09:39:39.275110Z","title":"Dynamic sparse training of diagonally sparse networks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14812","last_updated":"2026-07-21T01:15:24Z","snapshot_observed_at":"2026-08-07T06:33:28.742860Z","submitted_at":"2025-10-16T15:48:17Z","title":"SHUFFLESPARSE: Learned Shuffles for Structured Sparse Networks","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T09:39:39.275110Z"},"links":{"cited_paper":"/paper/2506.11449","citing_paper":"/paper/2510.14812"},"observation_digest":"sha256:252c8cd9b31e60ba2dcb845a3e41bfea09515cfd6b1fd7aea4dade59a84d7e46","observation_id":"03673a12-845b-497e-8a52-82f07014e9df","resolution":{"observed_at":"2026-08-04T09:39:39.275110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.11449/citation-record","integrity":"/paper/2506.11449/integrity","json":"/paper/2506.11449/citation-record.json","paper":"/paper/2506.11449"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:12.121642Z","title":"and Albert, R","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:12.121642Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:36bbcd3582397fd10bfb14157b50da3a61cb21f7aa7e0a31ff54bffd3e91289d","observation_id":"acb8e67f-a596-4da7-82fd-7545c858c552","resolution":{"observed_at":"2026-08-07T04:15:12.121642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:19.071083Z","title":"J., Frankle, J., and Guttag, J","venue":null,"work_id":"37d71d03-9999-4bb7-b209-c7742478ab1c","year":2020},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:12.186921Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:cc09a5f0d0cfb855597d32e3f566b9e9e05d885864bdda7d42c380114f079571","observation_id":"0c65c711-4611-4b73-bcad-1643c1c48c3c","resolution":{"observed_at":"2026-08-07T04:15:19.074082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02549","last_updated":"2022-05-31T07:25:52Z","snapshot_observed_at":"2026-08-07T13:45:53.364692Z","submitted_at":"2022-03-04T19:54:31Z","title":"Structured Pruning is All You Need for Pruning CNNs at Initialization","version":2},"cited_work":{"arxiv_id":"2203.02549","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.02549","snapshot_observed_at":"2026-08-07T04:15:18.718830Z","title":"Structured Pruning is All You Need for Pruning CNNs at Initialization","venue":"cs.CV","work_id":"59d45684-ff6c-437c-a55a-c4b51cd37a33","year":2022},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:12.251200Z"},"links":{"cited_paper":"/paper/2203.02549","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:2e9ca6c90f5ab1b51db9f6c64b18694d99f6d423d4e4d47bf90c8e41637d27fd","observation_id":"40e19aa5-6df1-4f8e-9572-30c231f7e5f6","resolution":{"observed_at":"2026-08-07T04:15:18.722802Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.09844","last_updated":"2022-02-27T07:42:30Z","snapshot_observed_at":"2026-08-02T09:05:26.776973Z","submitted_at":"2022-02-20T15:52:08Z","title":"Sparsity Winning Twice: Better Robust Generalization from More Efficient Training","version":3},"cited_work":{"arxiv_id":"2202.09844","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.09844","snapshot_observed_at":"2026-08-07T04:15:18.705647Z","title":"Sparsity Winning Twice: Better Robust Generalization from More Efficient Training","venue":"cs.CV","work_id":"0312bc34-58f2-4544-a5de-e27cb9edd0e2","year":2022},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:12.355089Z"},"links":{"cited_paper":"/paper/2202.09844","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:595285424c95c641213b72ee3053027d3f39e3c842d2473d431794b2bdd49b67","observation_id":"57136f77-88a8-4ef1-80eb-f5a0bff34629","resolution":{"observed_at":"2026-08-07T04:15:18.709283Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:19.061609Z","title":"Which layer is learning faster? a systematic exploration of layer-wise convergence rate for deep neural networks","venue":null,"work_id":"19a9ac3f-e423-4f3b-a214-14c5340e25fd","year":2023},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:12.417872Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:597e729fde1b339bce2693f9a4cf204f917d7c8c03cfe5a0e1cac2ab5b087d6b","observation_id":"a03bc3e3-c953-4975-a4bf-0ebc323ccdd5","resolution":{"observed_at":"2026-08-07T04:15:19.064856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:19.051686Z","title":"Trends in the dollar training cost of machine learning systems","venue":null,"work_id":"15c07469-d378-402c-9a93-0d4a5057cc3a","year":2023},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:12.464154Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:ba0987e9cac4d43a18f03cce2b592ae3b2a779d9f61e0d9fa27b824727323a61","observation_id":"ed57bb53-d414-4c72-8f9a-d1a9fcf79d0a","resolution":{"observed_at":"2026-08-07T04:15:19.054770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00029","last_updated":"2022-05-11T03:59:56Z","snapshot_observed_at":"2026-08-02T22:27:42.517397Z","submitted_at":"2021-11-30T19:00:03Z","title":"Pixelated Butterfly: Simple and Efficient Sparse training for Neural Network Models","version":2},"cited_work":{"arxiv_id":"2112.00029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.00029","snapshot_observed_at":"2026-08-07T04:15:18.691750Z","title":"Pixelated Butterfly: Simple and Efficient Sparse training for Neural Network Models","venue":"cs.LG","work_id":"e66f364c-25db-4b79-ad38-eada6fdaade9","year":2021},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:12.550091Z"},"links":{"cited_paper":"/paper/2112.00029","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:bf853dcb65fbd084501b0bb60a35bbdec32de4c67ca86bbb746727bd30068a77","observation_id":"729345dd-2fd7-435f-8055-f165664cb38d","resolution":{"observed_at":"2026-08-07T04:15:18.695298Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:12.682619Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:12.682619Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:97c6e01a7b43a7f2bcb1ff8497d9e0dd184baecc5de05ba38f19ac5931b5fae5","observation_id":"b08614df-628b-4ec4-80b7-315afda6cbf6","resolution":{"observed_at":"2026-08-07T04:15:12.682619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T04:15:12.689627Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:12.689627Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:3c94f9b2d4dd943815ee8a5472bf997de8b0c8719de20d4bfe0f24ea1cc220cb","observation_id":"977f8781-5290-41ff-b990-5bceaf766a17","resolution":{"observed_at":"2026-08-07T04:15:12.689627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:19.036091Z","title":"S., and Elsen, E","venue":null,"work_id":"ba945dfa-e4b7-4d18-a111-b5d40bf09e58","year":2020},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:12.780599Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:fd0bce4bbe82b99823cf3440965739de4ccd6eb6f7b4ab1537cb43ec8aa18333","observation_id":"71af4c9d-60e1-47e4-8570-205ac0ffbac1","resolution":{"observed_at":"2026-08-07T04:15:19.038904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03635","last_updated":"2019-03-04T15:51:11Z","snapshot_observed_at":"2026-08-05T23:54:27.386622Z","submitted_at":"2018-03-09T18:51:28Z","title":"The Lottery Ticket Hypothesis: Finding Sparse, Trainable Neural Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03635","snapshot_observed_at":"2026-08-07T04:15:12.943651Z","title":"and Carbin, M","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:12.943651Z"},"links":{"cited_paper":"/paper/1803.03635","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:f185f05dc73c982062b66ffd833f928d8bd87b173bb99fa85d42c372d928f1aa","observation_id":"9d4ee057-f126-4d8c-a6fc-337b5c2be220","resolution":{"observed_at":"2026-08-07T04:15:12.943651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:19.026292Z","title":"Learning both weights and connections for efficient neural network","venue":null,"work_id":"b2d5dd98-621b-4546-8a48-6e4fe0da70b5","year":2015},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:13.074504Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:a4c863ab3f4971e4960ec90cd8f38f4396ae5e7e0f2a9d0124b88cda1265d9d4","observation_id":"7f6f46cb-5ac4-4c29-885d-22f25bc2d968","resolution":{"observed_at":"2026-08-07T04:15:19.029862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01847","last_updated":"2024-10-27T14:40:08Z","snapshot_observed_at":"2026-08-07T14:26:42.001446Z","submitted_at":"2024-04-02T11:12:42Z","title":"Accelerating Transformer Pre-training with 2:4 Sparsity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01847","snapshot_observed_at":"2026-08-07T04:15:13.191537Z","title":"Accelerating transformer pre-training with 2: 4 sparsity","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:13.191537Z"},"links":{"cited_paper":"/paper/2404.01847","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:43b3a89a95ce3b02c3f8781057612cc67e793c3d1fa218aa137721e460ee8711","observation_id":"d152cb25-3ae8-4cb1-8d13-4394713d80a0","resolution":{"observed_at":"2026-08-07T04:15:13.191537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:19.016751Z","title":"Accelerated sparse neural training: A provable and efficient method to find n: m transposable masks","venue":null,"work_id":"637f7b6e-5bcf-4d43-af9d-e4d6d0a8378c","year":2021},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:13.289616Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:f22c78a9e8c438563a880b517601856bc326efa01672456680fea74d5ca3639f","observation_id":"eb264363-b1d7-4191-8313-f4a6585a3587","resolution":{"observed_at":"2026-08-07T04:15:19.020080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:19.006355Z","title":"K., Ma, H., Chen, T., Ding, Y., and Wang, Z","venue":null,"work_id":"8ad5e3ca-b36e-4282-bc0b-b49af1a35037","year":2022},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:13.447084Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:7a934b2ffcf3ff6bc376e3dc26173a9891dd832cb47fdc5740c8bad163620fb3","observation_id":"2a86ee1d-d278-4d43-90fe-7ca10031e26e","resolution":{"observed_at":"2026-08-07T04:15:19.009947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.997142Z","title":"Top-kast: Top-k always sparse training","venue":null,"work_id":"5e64db62-af9f-435f-991a-486f28875485","year":2020},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:13.607857Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:3bfa2785e64278aec1eb886bd13307543d06a3a3702fdb04002866a139e7941b","observation_id":"53d379a7-a660-408d-a7a2-fc6d8e2f386a","resolution":{"observed_at":"2026-08-07T04:15:19.000124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.988190Z","title":"Advancing dynamic sparse training by exploring optimization opportunities","venue":null,"work_id":"f0e9faec-2413-40c3-ad8f-a9ada15f9350","year":2024},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:13.735936Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:9f5af1926f571f7b16fc3c60cf19798bae4ec159b134ed881b5725aabf336f9e","observation_id":"4518509c-4179-46b5-bb1b-c9b859935517","resolution":{"observed_at":"2026-08-07T04:15:18.991215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.978569Z","title":"Exposing and exploiting fine-grained block structures for fast and accurate sparse training","venue":null,"work_id":"01cc2c56-e45e-4273-a1b0-6e7855212803","year":2022},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:13.836746Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:70568bd112e18c445343045a4617d0507df78b152424012086152e14e9d9b8e7","observation_id":"ba21eaf3-10cc-43a7-a18a-4e01981b2559","resolution":{"observed_at":"2026-08-07T04:15:18.981703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.969387Z","title":"and Hinton, G","venue":null,"work_id":"d0a8058c-9fc8-4bad-a42c-b78b1854fc7c","year":2009},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:13.981699Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:269e46ed5f0f352438dfe27789308db3c52b7603de241561c420b678d7ea36f3","observation_id":"fec6f463-af22-4611-bbde-0e662c2edf4e","resolution":{"observed_at":"2026-08-07T04:15:18.972521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02060","last_updated":"2023-09-08T14:45:48Z","snapshot_observed_at":"2026-08-02T02:22:26.294105Z","submitted_at":"2023-08-03T21:49:14Z","title":"Accurate Neural Network Pruning Requires Rethinking Sparse Optimization","version":2},"cited_work":{"arxiv_id":"2308.02060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.02060","snapshot_observed_at":"2026-08-07T04:15:18.647867Z","title":"Accurate Neural Network Pruning Requires Rethinking Sparse Optimization","venue":"cs.LG","work_id":"7a6310d9-187a-470d-a6e8-8a8477b72fb6","year":2023},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:14.110136Z"},"links":{"cited_paper":"/paper/2308.02060","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:774e8cfda2974a874024693266be5d4bf84f8fa710cb836c1a3d350290440c8d","observation_id":"1dba2fb0-3faa-4f49-817c-4cde8a6a2d67","resolution":{"observed_at":"2026-08-07T04:15:18.651445Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.960231Z","title":"S., Bernaschi, M., Nutt, W., Silvestri, F., and Vella, F","venue":null,"work_id":"8bbb3b7a-f56d-4dd1-8edd-c8c50c6fdab6","year":2022},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:14.267434Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:e763a5ee4263d578c192ef490c10f9dd542936b553864ba97d2a53264c5d4f8e","observation_id":"d9d85d36-5aa3-4e38-af01-d63c744a2aaa","resolution":{"observed_at":"2026-08-07T04:15:18.963332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:14.387444Z","title":"Crafting papers on machine learning","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:14.387444Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:c261016718176dfa214279151f9fa0b2a04b6003fbf8dca467726f7ac57cd311","observation_id":"ae4f1b34-4b9d-4e5a-a0b8-3d2d4a9c22da","resolution":{"observed_at":"2026-08-07T04:15:14.387444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02299","last_updated":"2024-02-21T23:31:49Z","snapshot_observed_at":"2026-08-03T12:05:13.333642Z","submitted_at":"2023-05-03T17:48:55Z","title":"Dynamic Sparse Training with Structured Sparsity","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02299","snapshot_observed_at":"2026-08-07T04:15:14.519561Z","title":"Dynamic sparse training with structured sparsity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:14.519561Z"},"links":{"cited_paper":"/paper/2305.02299","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:819e28045f040386baf7d3579d934057f436e92b1b0e56b7b06ae8ed49b5c163","observation_id":"4c9d4b81-0a21-4600-a0c2-d683edb36dc6","resolution":{"observed_at":"2026-08-07T04:15:14.519561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.02340","last_updated":"2019-02-23T07:45:29Z","snapshot_observed_at":"2026-07-06T07:06:10.289386Z","submitted_at":"2018-10-04T17:39:58Z","title":"SNIP: Single-shot Network Pruning based on Connection Sensitivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.02340","snapshot_observed_at":"2026-08-07T04:15:14.642977Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:14.642977Z"},"links":{"cited_paper":"/paper/1810.02340","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:7ccd203d645a435419a645640e29fa29cd67990ce22a18e9d2bfad2aa9049690","observation_id":"e337ac52-7dca-4964-b444-d612ec7569d4","resolution":{"observed_at":"2026-08-07T04:15:14.642977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.944682Z","title":"Towards optimal structured cnn pruning via generative adversarial learning","venue":null,"work_id":"c68614ac-b2c1-4112-9bed-7315b1e35ca2","year":2019},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:14.756071Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:234f9c737083227ebf18c1f1e51cd6014b8575c5eb81b16ad1a7823164008b57","observation_id":"692a9328-fde3-49fc-afea-0ca883c2da92","resolution":{"observed_at":"2026-08-07T04:15:18.947681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.934840Z","title":"and Wang, Z","venue":null,"work_id":"4ebcb52c-8d63-4ed1-9918-07aa719303ab","year":2023},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:14.851369Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:47cbfd235dc5e87aa2312b6453ce2fe3e78d38dd9fb6dc82a6b1d2944e5529c1","observation_id":"dd0bc6a1-2762-4932-903e-ef7d01e03c76","resolution":{"observed_at":"2026-08-07T04:15:18.938390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.11626","last_updated":"2019-06-27T13:31:30Z","snapshot_observed_at":"2026-08-02T11:51:02.442023Z","submitted_at":"2019-06-27T13:31:30Z","title":"On improving deep learning generalization with adaptive sparse connectivity","version":1},"cited_work":{"arxiv_id":"1906.11626","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.11626","snapshot_observed_at":"2026-08-07T04:15:18.613894Z","title":"On improving deep learning generalization with adaptive sparse connectivity","venue":"cs.NE","work_id":"4f42b0fb-f4bd-4eee-bb34-20fa57c627c5","year":2019},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:15.027008Z"},"links":{"cited_paper":"/paper/1906.11626","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:5e12e66ba18361cd1898cf95356dacb1cbf05aa23c755176537290bcf326c990","observation_id":"62e2ff50-b76c-4170-be81-a06b11055d52","resolution":{"observed_at":"2026-08-07T04:15:18.617358Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10912","last_updated":"2024-10-14T03:35:11Z","snapshot_observed_at":"2026-07-06T19:33:21.541657Z","submitted_at":"2024-10-14T03:35:11Z","title":"AlphaPruning: Using Heavy-Tailed Self Regularization Theory for Improved Layer-wise Pruning of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10912","snapshot_observed_at":"2026-08-07T04:15:15.173321Z","title":"W., and Yang, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:15.173321Z"},"links":{"cited_paper":"/paper/2410.10912","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:3ca03e6a902be015d54fa47b930e5ccfb9f563b054ec52f7dc04393a2e4e2d6e","observation_id":"bd0d52fe-8eb6-4fb0-8b65-76e695a353d5","resolution":{"observed_at":"2026-08-07T04:15:15.173321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"article/2402645","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.586575Z","title":"Ai beats humans for the first time in physical skill game","venue":null,"work_id":"f4c6f681-ba73-43b3-a005-7ca3a0f772f8","year":2023},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:15.284906Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:9dacb6b78d94f2dc82a97fa31d725d0ddb91dc967068df058a97fb8e2044d9b0","observation_id":"289693ac-41ec-4bc2-b540-6806beeba823","resolution":{"observed_at":"2026-08-07T04:15:18.591396Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.924739Z","title":null,"venue":null,"work_id":"ee281715-999e-4331-86d8-f43bb8b3feef","year":1993},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:15.411618Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:688cab21a40a6992c5b2f909c1b729d38705952d6e523fb439d12f218c667312","observation_id":"83104951-6e69-4b4e-a2c7-035a7bd45907","resolution":{"observed_at":"2026-08-07T04:15:18.928197Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-07T04:15:15.495104Z","title":"Pointer sentinel mixture models","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:15.495104Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:47faa04ee17c280749a610d760fe599906670ffe52b3838b3ae6f36876626f4f","observation_id":"f72043d6-96c0-4463-9b1d-431d8a98c81f","resolution":{"observed_at":"2026-08-07T04:15:15.495104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08378","last_updated":"2021-04-16T21:27:32Z","snapshot_observed_at":"2026-08-04T11:24:11.301809Z","submitted_at":"2021-04-16T21:27:32Z","title":"Accelerating Sparse Deep Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08378","snapshot_observed_at":"2026-08-07T04:15:15.580457Z","title":"A., Pool, J., Stosic, D., Stosic, D., Venkatesh, G., Yu, C., and Micikevicius, P","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:15.580457Z"},"links":{"cited_paper":"/paper/2104.08378","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:96bd9e437ce769239c52d794bf69acd5cb93c7298d0611c9cb7f87ad32e59bcc","observation_id":"b3434182-04bd-466f-bd00-afc3df276a46","resolution":{"observed_at":"2026-08-07T04:15:15.580457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.913987Z","title":"C., Mocanu, E., Stone, P., Nguyen, P","venue":null,"work_id":"7e8a29bf-37f0-4680-b314-18810aaed8a9","year":2018},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:15.689578Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:5391221efa2a57f9049302024e6ae3e189aee98020e86edfe35c5b5e0031d10b","observation_id":"ceafbc9e-6f8a-4068-a8d1-d6ddccedd90e","resolution":{"observed_at":"2026-08-07T04:15:18.917396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.903914Z","title":"Variational dropout sparsifies deep neural networks","venue":null,"work_id":"26406956-9a47-432c-a7cd-81fcb4a3beb0","year":2017},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:15.771170Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:42809ab3ba14cf25f6e531cc161c5091c4053052bdf66a73e17e1e3af1579000","observation_id":"5f638935-eea7-4fe0-922c-40062837fb54","resolution":{"observed_at":"2026-08-07T04:15:18.907093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.06440","last_updated":"2017-06-08T19:53:26Z","snapshot_observed_at":"2026-08-07T07:29:29.524604Z","submitted_at":"2016-11-19T22:48:30Z","title":"Pruning Convolutional Neural Networks for Resource Efficient Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.06440","snapshot_observed_at":"2026-08-07T04:15:15.880234Z","title":"Pruning convolutional neural networks for resource efficient inference","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:15.880234Z"},"links":{"cited_paper":"/paper/1611.06440","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:96a2f181cdb5395801c5eceac68fadf28e416ae7243fd01b13e64741062c200a","observation_id":"227376ee-6b74-4c76-b984-06bab8181380","resolution":{"observed_at":"2026-08-07T04:15:15.880234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.893568Z","title":"Importance estimation for neural network pruning","venue":null,"work_id":"9c66d36c-53f4-4a22-bb91-dd8670e6800b","year":2019},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:15.969164Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:44f1d8036d6a3a901a5ddfa33fda197f9e31e91cbb4a478bc95c9131596be862","observation_id":"90ce7414-658d-4032-85a2-07b4da0ec235","resolution":{"observed_at":"2026-08-07T04:15:18.897082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.883616Z","title":"and Wang, X","venue":null,"work_id":"3330d4b2-a690-4459-a784-0696bd495ce1","year":2019},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:16.070264Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:8a365c92e8f5efeba4c64cf21872f77e1f2e0db4270914de03c0a0110cd42a01","observation_id":"9cd46bb6-90ba-4ce9-aed3-c216d41b24cc","resolution":{"observed_at":"2026-08-07T04:15:18.886787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.872552Z","title":"S., Besta, M., Vella, F., and Hoefler, T","venue":null,"work_id":"1a7b00f7-ef25-4013-b2a1-2bd768bca2d6","year":2024},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:16.197211Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:31aea131f6b812378aa78a101fe0039da1f95c09b3e744f93d4d12ecb677ae0a","observation_id":"bfb3db17-fd5a-4647-8287-cdc359742e2c","resolution":{"observed_at":"2026-08-07T04:15:18.875946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:16.282965Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:16.282965Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:14abc0705d6d2ef12cc305d1b2d985bf8b7087554b18d77ce548a21b899585c0","observation_id":"06e341cd-7ab5-48ef-987f-b7d685c155a5","resolution":{"observed_at":"2026-08-07T04:15:16.282965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.857089Z","title":"E., Puigcerver, J., Djolonga, J., Peyr \\'e , G., and Blondel, M","venue":null,"work_id":"6885178f-906b-4b06-9b9d-cea9db875dad","year":2023},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:16.383763Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:588faecff79d5584acb266a5577d18d1986738984cba011ad4f0f8baf032e1a4","observation_id":"1952fe18-e200-4e61-ae24-c536886ba887","resolution":{"observed_at":"2026-08-07T04:15:18.860400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.847693Z","title":"Game-playing deepmind ai can beat top humans at chess, go and poker","venue":null,"work_id":"a312390c-878d-4fd9-a7bc-7e04acdac665","year":2023},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:16.491995Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:bc363022a0792b8254b7875caf79426d3f089649adbf1d45751f555f93302c93","observation_id":"7858e193-bf33-40df-929e-318005c0add0","resolution":{"observed_at":"2026-08-07T04:15:18.850927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-07-06T15:44:42.776459Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-07T04:15:16.634343Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:16.634343Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:fb9666448122c6134744c775138684fa543df17628d6e83aa6936ce81c68188a","observation_id":"350429b3-ba93-4a8c-8596-34381aed502b","resolution":{"observed_at":"2026-08-07T04:15:16.634343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.836458Z","title":"L., and Ganguli, S","venue":null,"work_id":"8b059654-9fd4-4c86-8b75-4826a6b02f6c","year":2020},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:16.786934Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:26ae7b2d04bc4df0a9de26d526ccec9caa1535e71d98f67f8f4e73b150f71673","observation_id":"addffe9e-c86d-4ac9-b2ae-95317f84a5ef","resolution":{"observed_at":"2026-08-07T04:15:18.839889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.825569Z","title":"K., Joyce, K","venue":null,"work_id":"13086a18-b9ed-402a-85df-6d07141845ba","year":2011},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:16.913534Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:8fb1204dbb8ae227125c98b5f6836962f4e8198c087cc9ce129d54cd7efff438","observation_id":"ae1a8ba8-6f04-44ea-8375-e5fb078e67d4","resolution":{"observed_at":"2026-08-07T04:15:18.828880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.814406Z","title":"O., Houlsby, N., Kolesnikov, A., Beyer, L., Zhai, X., Unterthiner, T., Yung, J., Steiner, A., Keysers, D., Uszkoreit, J., et al","venue":null,"work_id":"51ae1a6f-19ff-42f8-b26c-c967b470bcdb","year":2021},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:16.958211Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:9336e6f483dbd9114b8452c65489c38b77ed06c144eafbb7412ff6436742c61c","observation_id":"91123f71-7a2b-406f-b4f6-9f44c16ce817","resolution":{"observed_at":"2026-08-07T04:15:18.818048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.07376","last_updated":"2020-08-07T00:02:33Z","snapshot_observed_at":"2026-08-03T13:48:05.558970Z","submitted_at":"2020-02-18T05:14:47Z","title":"Picking Winning Tickets Before Training by Preserving Gradient Flow","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.07376","snapshot_observed_at":"2026-08-07T04:15:17.025375Z","title":"Picking winning tickets before training by preserving gradient flow","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:17.025375Z"},"links":{"cited_paper":"/paper/2002.07376","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:37707bf07ce84d73d4639a8acc5f32e6cff8c6d3801704b21d0f62c86244c905","observation_id":"e7fd8b2d-45e8-4de9-ad77-f721bf722307","resolution":{"observed_at":"2026-08-07T04:15:17.025375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.803029Z","title":null,"venue":null,"work_id":"749faf85-c926-435d-969a-5e38b3ed1450","year":1998},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:17.141937Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:5741376f86bd3f6c78846aed95d372168ba206d2f975d6f5c6be5682abcc6d48","observation_id":"10faa5a7-a836-4566-9fbb-905bd2f1f672","resolution":{"observed_at":"2026-08-07T04:15:18.806267Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.792559Z","title":"and Busato, F","venue":null,"work_id":"218de94e-fd15-4a1e-a74e-e323fb874449","year":2021},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:17.266215Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:36599be005ce0e01eb5598684e9d5a1c65cebcda1aad86dcf421955f86ee0022","observation_id":"9f07e15e-e391-4d60-ba4c-8de272312296","resolution":{"observed_at":"2026-08-07T04:15:18.795946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00335","last_updated":"2023-01-29T22:05:59Z","snapshot_observed_at":"2026-07-06T14:36:29.037684Z","submitted_at":"2023-01-01T03:10:45Z","title":"Pruning Before Training May Improve Generalization, Provably","version":3},"cited_work":{"arxiv_id":"2301.00335","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.00335","snapshot_observed_at":"2026-08-07T04:15:18.349026Z","title":"Pruning Before Training May Improve Generalization, Provably","venue":"cs.LG","work_id":"1a7c3d6f-0214-43d8-95d8-d03fbd447dbd","year":2023},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:17.280525Z"},"links":{"cited_paper":"/paper/2301.00335","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:e02f9f40ac1cb089e700f62ebbdb2b26933843c2e95d4eb5913c61fe346eb712","observation_id":"3376bb61-0524-49a5-8cad-369bc5a2645a","resolution":{"observed_at":"2026-08-07T04:15:18.418513Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.782641Z","title":"Global vision transformer pruning with hessian-aware saliency","venue":null,"work_id":"960a743f-2fec-4bf6-992b-aac86527a496","year":2023},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:17.284679Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:b8194166e5d51887f0e1c56221d69f6d94b7f0e5c5f16cfbb9795746624d9851","observation_id":"58184fa3-9626-463e-9c5b-9e2a9ce7a595","resolution":{"observed_at":"2026-08-07T04:15:18.785703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.772397Z","title":"Width & depth pruning for vision transformers","venue":null,"work_id":"1eb9c726-1461-47be-b459-f471a843fdb4","year":2022},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:17.353691Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:3ff87f46a646c683ffa42caf5daec348bc1c67e2cc5bb6d534623fc2fc145cd3","observation_id":"a70fae9d-7254-4917-9757-0b8da493eb05","resolution":{"observed_at":"2026-08-07T04:15:18.776186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.762487Z","title":"Mest: Accurate and fast memory-economic sparse training framework on the edge","venue":null,"work_id":"267ffbba-b488-4454-a5ac-d56d5c2a40fb","year":2021},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:17.434429Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:32c1a421acd06ea977f99c6c132d3e7a3d612dca52598547a44b9f660eefc1ef","observation_id":"e72ec91d-b684-4177-b31d-22ebdc9b0321","resolution":{"observed_at":"2026-08-07T04:15:18.765956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03303","last_updated":"2026-05-09T05:30:15Z","snapshot_observed_at":"2026-07-06T16:03:14.694457Z","submitted_at":"2023-08-07T05:12:27Z","title":"LoRA-FA: Efficient and Effective Low Rank Representation Fine-tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03303","snapshot_observed_at":"2026-08-07T04:15:17.585257Z","title":"Lora-fa: Memory-efficient low-rank adaptation for large language models fine-tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:17.585257Z"},"links":{"cited_paper":"/paper/2308.03303","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:be9ae2c69d8ea9f862ac64cd62d038b40d964b941e5649885e9d1048107ca74e","observation_id":"73226ca3-5aff-4b80-840d-df22a66609df","resolution":{"observed_at":"2026-08-07T04:15:17.585257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.750618Z","title":"M., Yan, G., and Li, X","venue":null,"work_id":"c3d0a921-22e4-4487-a218-20e46979b929","year":2023},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:17.589660Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:b2b4df69cea819ebbcdb0b1be3cb1b5367fc62f5c97d569ca2a61616398a076d","observation_id":"8e7ba500-4ae3-4b2b-af2f-6e6ba0cd9ca6","resolution":{"observed_at":"2026-08-07T04:15:18.754750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.739632Z","title":null,"venue":null,"work_id":"46907158-e8ed-4451-9c65-acb5bb56e932","year":2024},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:17.665272Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:20a8a39618dc4b539935d379c66cf3f4ebfe1418ec0c65e8fe56a2bff4ed5c8b","observation_id":"c3079ea3-c142-4968-b340-ab9909a34f67","resolution":{"observed_at":"2026-08-07T04:15:18.743027Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.19107","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.218704Z","title":null,"venue":null,"work_id":"0a2a3791-4947-49fc-86ec-e5ec68f545d2","year":2025},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:17.779718Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:ef9f5cfd21ce39ea66e8b2d976d891d6e3e4be43852d3608f5fdd25fc78ab20d","observation_id":"c5a433ee-edba-4552-8c21-6b8c74307a28","resolution":{"observed_at":"2026-08-07T04:15:18.249954Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:17.887587Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:17.887587Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:dc0e7a5d52673e8bb6cfbe8b90c4e649a18519ff094a9dfedc2bac1f44656b55","observation_id":"ed35a736-af75-43be-995c-af4228503acf","resolution":{"observed_at":"2026-08-07T04:15:17.887587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T22:08:27.189281Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":20,"verified_exact":6,"verified_fuzzy":29},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 1 inbound Pith citation observation for arXiv:2506.11449."}