{"as_of":"2026-08-06T15:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:630a06896cff17f9dde47b7c6bbe73b05d7d68aa6c6c68f566e7010b4de3472b","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T09:01:16.991413Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T03:33:45.192139Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T07:16:28.884137Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"cited_work":{"arxiv_id":"2506.12876","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12876","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Maskpro: Linear-space probabilistic learning for strict (n: M)-sparsity on large language models.arXiv preprint arXiv:2506.12876","venue":null,"work_id":"fa290085-42c1-461e-b21c-36d491e25291","year":null},"citing_paper":{"arxiv_id":"2605.08809","last_updated":"2026-05-09T08:59:13Z","snapshot_observed_at":"2026-08-02T18:35:09.983848Z","submitted_at":"2026-05-09T08:59:13Z","title":"SimReg: Achieving Higher Performance in the Pretraining via Embedding Similarity Regularization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T03:33:45.192139Z"},"links":{"cited_paper":"/paper/2506.12876","citing_paper":"/paper/2605.08809"},"observation_digest":"sha256:cac5e516021a131ab364f081ccf9540132fe895e3319102bc67a01dc88893603","observation_id":"1018947d-9799-41ad-96ba-0ab476a704d6","resolution":{"observed_at":"2026-05-14T01:54:43.618312Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.12876/citation-record","integrity":"/paper/2506.12876/integrity","json":"/paper/2506.12876/citation-record.json","paper":"/paper/2506.12876"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:924f4e22e32bf3e1a2c061067a37beaf6b9cc8e56f421bb97d7ddc5cb7fd9933","observation_id":"0b7a8745-443f-4d20-84d3-979a884d812c","resolution":{"observed_at":"2026-05-19T09:02:14.533711Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15024","last_updated":"2024-02-09T17:59:40Z","snapshot_observed_at":"2026-07-06T17:21:01.918787Z","submitted_at":"2024-01-26T17:35:45Z","title":"SliceGPT: Compress Large Language Models by Deleting Rows and Columns","version":2},"cited_work":{"arxiv_id":"2401.15024","doi":"10.48550/arxiv.2401.15024","metadata_source":"pith","pith_arxiv_id":"2401.15024","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Slicegpt: Compress large language models by deleting rows and columns","venue":"cs.LG","work_id":"f3275cfc-b514-4a2e-be9d-1fa27726e5f4","year":2024},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"cited_paper":"/paper/2401.15024","citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:7bf5233395b732e0cadf5fbceb7dcb92d33b3abcc406f586d693e684570b0936","observation_id":"12a7463b-ae81-4132-86b9-7725ce243f1c","resolution":{"observed_at":"2026-05-19T09:02:14.510181Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14103","last_updated":"2025-08-01T13:28:50Z","snapshot_observed_at":"2026-07-06T14:23:00.425558Z","submitted_at":"2022-11-25T13:36:11Z","title":"Conditional Gradient Methods","version":5},"cited_work":{"arxiv_id":"2211.14103","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.14103","snapshot_observed_at":"2026-07-03T17:08:43.677845Z","title":"arXiv preprint arXiv:2211.14103 (2022)","venue":null,"work_id":"d6e88c68-158c-4485-ba9a-5c20dc721781","year":2022},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"cited_paper":"/paper/2211.14103","citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:b232f944c911de06c4f259bf413a4d278d765c6c6dc0fc73ad77bf1409a03256","observation_id":"2b846821-4029-47fd-8e49-53ca091ada16","resolution":{"observed_at":"2026-05-19T09:02:14.502332Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are few-shot learners","venue":null,"work_id":"f93ff324-f230-4a46-97b9-6b103c35585d","year":1901},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:e674be565f236c73f064891c2b06b97d889bf8d9c415585a17cbb8ff00abc490","observation_id":"b8c0716b-0594-427a-b5e8-3dd8ef99673c","resolution":{"observed_at":"2026-05-19T09:02:15.329803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18356","last_updated":"2023-10-31T04:21:33Z","snapshot_observed_at":"2026-07-06T16:39:40.673808Z","submitted_at":"2023-10-24T00:47:26Z","title":"LoRAShear: Efficient Large Language Model Structured Pruning and Knowledge Recovery","version":2},"cited_work":{"arxiv_id":"2310.18356","doi":"10.48550/arxiv.2310.18356","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.18356","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Lorashear: Efficient large language model structured pruning and knowledge recovery","venue":"arXiv (Cornell University)","work_id":"64d47465-b47b-4276-8968-6ff6e3805b77","year":2023},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"cited_paper":"/paper/2310.18356","citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:1f459db899f64640da9d55d8690eebcec90eae8744a83d1a257e2a331789dde2","observation_id":"e9d74994-b7e5-449e-a920-06b4435db414","resolution":{"observed_at":"2026-05-19T09:02:14.482082Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00277","last_updated":"2022-06-02T03:44:04Z","snapshot_observed_at":"2026-07-06T13:16:13.214340Z","submitted_at":"2022-06-01T07:09:01Z","title":"Task-Specific Expert Pruning for Sparse Mixture-of-Experts","version":2},"cited_work":{"arxiv_id":"2206.00277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.00277","snapshot_observed_at":"2026-07-03T21:18:58.223513Z","title":"org/CorpusID:235755472","venue":null,"work_id":"e2366bed-1890-4253-b528-88fa5507128e","year":2022},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"cited_paper":"/paper/2206.00277","citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:5e35da9636524e9669e8345beb5b6109fdefe33152a9378f2587df312f7b4772","observation_id":"bdcbcc22-64a4-44ed-b14d-8d77749cc551","resolution":{"observed_at":"2026-05-19T09:02:14.475061Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04902","last_updated":"2024-04-08T22:42:49Z","snapshot_observed_at":"2026-07-30T16:56:04.978117Z","submitted_at":"2023-11-08T18:59:54Z","title":"Beyond Size: How Gradients Shape Pruning Decisions in Large Language Models","version":2},"cited_work":{"arxiv_id":"2311.04902","doi":"10.48550/arxiv.2311.04902","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04902","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beyond size: How gradients shape pruning decisions in large language models","venue":"arXiv (Cornell University)","work_id":"aa62a001-e6f8-486a-8c34-aa43bdcf3aa2","year":2024},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"cited_paper":"/paper/2311.04902","citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:6b8bccbdb815c5feb43ea81df50ad45b050dfaa168c540c5656749a333bf0621","observation_id":"6635c67d-0394-4f16-8376-a3484e1ddbd7","resolution":{"observed_at":"2026-05-19T09:02:14.488887Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":"2401.02954","doi":"10.48550/arxiv.2401.02954","metadata_source":"pith","pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","venue":"cs.CL","work_id":"01b10587-025b-499d-8ba3-7a538d24c2d6","year":2024},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:8cbfe91a82b7e2a2215d6c170c4023f73286db140e3cde367968fe9fc8abea4d","observation_id":"810e8927-0e8b-4329-8bb2-14774f4a8dd6","resolution":{"observed_at":"2026-05-19T09:02:14.516002Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2402.05406","doi":"10.48550/arxiv.2402.05406","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Everybody Prune Now: Structured Pruning of LLMs with only Forward Passes","venue":"arXiv (Cornell University)","work_id":"f33b34c7-9c91-4eb5-ba6f-d1a69dbe552d","year":2024},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:a63462eb97545cc16ab019432a8cb6050d31883f77004c91c8d5a2b7d38e3b90","observation_id":"b760cdbf-06ce-4c04-bc65-bf92194acf81","resolution":{"observed_at":"2026-05-19T09:02:14.539340Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02924","last_updated":"2024-06-05T04:25:23Z","snapshot_observed_at":"2026-07-06T18:25:40.229186Z","submitted_at":"2024-06-05T04:25:23Z","title":"Pruner-Zero: Evolving Symbolic Pruning Metric from scratch for Large Language Models","version":1},"cited_work":{"arxiv_id":"2406.02924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.02924","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Peijie Dong, Lujun Li, Zhenheng Tang, Xiang Liu, Xinglin Pan, Qiang Wang, and Xiaowen Chu","venue":null,"work_id":"c0e64a84-a9fc-444f-9c31-3fd5aa71f709","year":2024},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"cited_paper":"/paper/2406.02924","citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:551f1179f87ff204d4285eeed2cd1d5ac17a5de2133a09442a9060053b996a28","observation_id":"25088480-6b77-4779-a666-6d74713839d7","resolution":{"observed_at":"2026-05-19T09:02:14.450120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03635","last_updated":"2019-03-04T15:51:11Z","snapshot_observed_at":"2026-08-05T23:54:27.386622Z","submitted_at":"2018-03-09T18:51:28Z","title":"The Lottery Ticket Hypothesis: Finding Sparse, Trainable Neural Networks","version":5},"cited_work":{"arxiv_id":"1803.03635","doi":null,"metadata_source":"pith","pith_arxiv_id":"1803.03635","snapshot_observed_at":"2026-07-04T10:29:45.051409Z","title":"The Lottery Ticket Hypothesis: Finding Sparse, Trainable Neural Networks","venue":"cs.LG","work_id":"b2db7960-3633-4685-8697-051ee8d141cc","year":2018},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"cited_paper":"/paper/1803.03635","citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:176d9f0cdb75c0549c526ed7b978d5a9afd73aa66ac977f5f94f866b4c3f521f","observation_id":"a4a77b2c-73d3-4780-8bc1-da80d7f3da57","resolution":{"observed_at":"2026-05-19T09:02:14.468374Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00774","last_updated":"2023-03-22T12:33:46Z","snapshot_observed_at":"2026-08-01T14:54:18.258666Z","submitted_at":"2023-01-02T17:48:56Z","title":"SparseGPT: Massive Language Models Can Be Accurately Pruned in One-Shot","version":3},"cited_work":{"arxiv_id":"2301.00774","doi":"10.48550/arxiv.2301.00774","metadata_source":"pith","pith_arxiv_id":"2301.00774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sparsegpt: Massive language models can be accurately pruned in one-shot","venue":"cs.LG","work_id":"c299c96a-ab17-4fd6-9c67-201f8d8f1138","year":2023},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"cited_paper":"/paper/2301.00774","citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:88b21e29266304d3a2977eece95e63f6d30a7bddf1b5c30c0853457da7504c05","observation_id":"169e84d6-5917-43a8-afc1-1daf4e1d77a4","resolution":{"observed_at":"2026-05-19T09:02:14.432385Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"records/1260860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:47:14.558044Z","title":"He, B., Yin, L., Zhen, H.-L., Liu, S., Wu, H., Zhang, X., Yuan, M., and Ma, C","venue":null,"work_id":"e7e9d443-273d-4722-8ec7-59adb893de0e","year":2024},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:d50c47d16a568219678c7560134db5fc6a8796b0daaa30171844cdf2f6aea2ed","observation_id":"ae558d44-2087-42b7-a42f-9186c26ae340","resolution":{"observed_at":"2026-05-19T09:02:14.438600Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1510.00149","last_updated":"2016-02-15T06:25:40Z","snapshot_observed_at":"2026-08-04T16:59:47.843960Z","submitted_at":"2015-10-01T09:03:44Z","title":"Deep Compression: Compressing Deep Neural Networks with Pruning, Trained Quantization and Huffman Coding","version":5},"cited_work":{"arxiv_id":"1510.00149","doi":"10.48550/arxiv.1510.00149","metadata_source":"pith","pith_arxiv_id":"1510.00149","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep Compression: Compressing Deep Neural Networks with Pruning, Trained Quantization and Huffman Coding","venue":"cs.CV","work_id":"d79f6a26-2d92-4f7c-aea0-8aabf3b668c8","year":2015},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"cited_paper":"/paper/1510.00149","citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:89bd1c52dbc32d1991e2f00f939fb07218097519df27d8966078903b78fece1b","observation_id":"0c45894e-7e30-48af-ae59-49fa6f643542","resolution":{"observed_at":"2026-05-19T09:02:14.418983Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T18:20:38.506383+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T18:20:38.506383+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:64928214fb4c69bdfead3fd9513d445b2b7247a5ccc7dd3b23adc9306c25bcf0","observation_id":"bcdd5286-1cf7-481f-8d0a-493237f2079f","resolution":{"observed_at":"2026-05-19T09:02:14.425268Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10054","last_updated":"2023-10-16T04:27:36Z","snapshot_observed_at":"2026-08-01T15:12:31.450929Z","submitted_at":"2023-10-16T04:27:36Z","title":"NASH: A Simple Unified Framework of Structured Pruning for Accelerating Encoder-Decoder Language Models","version":1},"cited_work":{"arxiv_id":"2310.10054","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10054","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nash: A simple unified framework of structured pruning for accelerating encoder-decoder language models","venue":null,"work_id":"b6fe6df2-0ba9-45b2-bace-d37eb569ac36","year":null},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"cited_paper":"/paper/2310.10054","citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:072c707c410d42794e754c2aee09edcaa5df02e8cba9e42ed777e4ec524b47df","observation_id":"ea9901ba-def2-41da-b32b-3e175a3b8147","resolution":{"observed_at":"2026-05-19T09:02:14.444063Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12570","last_updated":"2025-01-29T03:11:03Z","snapshot_observed_at":"2026-07-06T20:24:12.803909Z","submitted_at":"2025-01-22T01:35:11Z","title":"O1-Pruner: Length-Harmonizing Fine-Tuning for O1-Like Reasoning Pruning","version":2},"cited_work":{"arxiv_id":"2501.12570","doi":"10.48550/arxiv.2501.12570","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12570","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"O1-pruner: Length-harmonizing fine-tuning for o1-like reasoning pruning","venue":"ArXiv.org","work_id":"133f3b9f-d49a-46dd-9844-40063846c9ee","year":2026},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"cited_paper":"/paper/2501.12570","citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:eae93819ee2068479ce8dc49ffea4332eec057ab56534beb78eea3cb1304e4d9","observation_id":"107f5e7c-ba76-4f8c-951a-31ef40885737","resolution":{"observed_at":"2026-05-19T09:02:14.462154Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03853","last_updated":"2024-10-11T09:43:32Z","snapshot_observed_at":"2026-08-03T01:48:18.654934Z","submitted_at":"2024-03-06T17:04:18Z","title":"ShortGPT: Layers in Large Language Models are More Redundant Than You Expect","version":3},"cited_work":{"arxiv_id":"2403.03853","doi":"10.48550/arxiv.2403.03853","metadata_source":"pith","pith_arxiv_id":"2403.03853","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shortgpt: Layers in large language models are more redundant than you expect","venue":"cs.CL","work_id":"195a45aa-5b87-4058-97eb-f08eca8ee8c6","year":2024},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"cited_paper":"/paper/2403.03853","citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:c859b09fead93bed565a44a8cb613602cf2907d5c60fcb0943398de5a7761dd3","observation_id":"7c1ba13a-6e5b-43b2-be41-5d9fde396e16","resolution":{"observed_at":"2026-05-19T09:02:14.495620Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08378","last_updated":"2021-04-16T21:27:32Z","snapshot_observed_at":"2026-08-04T11:24:11.301809Z","submitted_at":"2021-04-16T21:27:32Z","title":"Accelerating Sparse Deep Neural Networks","version":1},"cited_work":{"arxiv_id":"2104.08378","doi":"10.48550/arxiv.2104.08378","metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08378","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2104.08378 , year=","venue":"arXiv (Cornell University)","work_id":"44f2e950-e65c-4db4-8ce1-f8c041547592","year":2021},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"cited_paper":"/paper/2104.08378","citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:72eaa5190783d653a49704a1f40e92b865ece628b561be4eb3fce8f575fdd2b9","observation_id":"7e2c1e45-5b1a-4a8b-84bd-163db5c66d47","resolution":{"observed_at":"2026-05-19T09:02:14.394137Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03589","last_updated":"2023-04-07T11:13:23Z","snapshot_observed_at":"2026-08-06T05:52:40.025089Z","submitted_at":"2023-04-07T11:13:23Z","title":"On Efficient Training of Large-Scale Deep Learning Models: A Literature Review","version":1},"cited_work":{"arxiv_id":"2304.03589","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.03589","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXivabs/2304.03589(2023) 3","venue":null,"work_id":"9e3218d0-3692-431d-88c5-6ab844e3d472","year":2023},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"cited_paper":"/paper/2304.03589","citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:57ddff13dcc73dc51c99a8ca116d961c9d3da2190daf43f0f2516ec1af4d97ce","observation_id":"1597a848-3014-4030-b0a8-c9a05d339192","resolution":{"observed_at":"2026-05-19T09:02:14.400163Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11796","last_updated":"2024-12-09T18:31:01Z","snapshot_observed_at":"2026-08-04T02:12:19.734094Z","submitted_at":"2024-08-21T17:38:48Z","title":"LLM Pruning and Distillation in Practice: The Minitron Approach","version":4},"cited_work":{"arxiv_id":"2408.11796","doi":"10.48550/arxiv.2408.11796","metadata_source":"pith","pith_arxiv_id":"2408.11796","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llm pruning and distillation in practice: The minitron approach","venue":"cs.CL","work_id":"05faf480-8ccd-499e-af9e-dddde50a7987","year":2024},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"cited_paper":"/paper/2408.11796","citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:f0e9f27be4441f056ce6cca58ce62f6fe27a1931a637d295c7ce7808ff931cec","observation_id":"cc848090-bc8a-497f-a8a7-fcd089bc488c","resolution":{"observed_at":"2026-05-19T09:02:14.406550Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-07-06T15:44:42.776459Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.11695","doi":"10.48550/arxiv.2306.11695","metadata_source":"pith","pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Simple and Effective Pruning Approach for Large Language Models","venue":"cs.CL","work_id":"e764df7f-c928-4b41-812e-352750f475c2","year":2023},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:43b1aa33f0797db3cb07f7010aeb42db167596c5e3f7bdcc0680ec14f6706950","observation_id":"50fb2b9b-0ebf-4bc4-b112-afebe82b8c26","resolution":{"observed_at":"2026-05-19T09:02:14.413055Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":"2403.08295","doi":"10.48550/arxiv.2403.08295","metadata_source":"pith","pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemma: Open Models Based on Gemini Research and Technology","venue":"cs.CL","work_id":"a9ea2870-df28-40b8-a9e0-a7e9a116f793","year":2024},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:b95761013f7b9ee29a7da5b9b18cbc41b70665ac4aea311f65b64e22b4fde444","observation_id":"b0bc6a4f-15bd-453c-b8be-7c725b3b8c12","resolution":{"observed_at":"2026-05-19T09:02:14.455939Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:583d27a426d32e75033746a77478815711b2e74049f5ad576b1a9267318ce724","observation_id":"6606bfda-ff8d-4616-b902-ea66d1954656","resolution":{"observed_at":"2026-05-19T09:02:14.527739Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10285","last_updated":"2023-09-19T03:20:02Z","snapshot_observed_at":"2026-08-01T16:15:23.171765Z","submitted_at":"2023-09-19T03:20:02Z","title":"Flash-LLM: Enabling Cost-Effective and Highly-Efficient Large Generative Model Inference with Unstructured Sparsity","version":1},"cited_work":{"arxiv_id":"2309.10285","doi":"10.48550/arxiv.2309.10285","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.10285","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flash-llm: Enabling cost-effective and highly-efficient large generative model inference with unstructured sparsity","venue":"arXiv (Cornell University)","work_id":"7dad54d7-b04e-46f6-a691-73a220bcd3d9","year":2023},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"cited_paper":"/paper/2309.10285","citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:f6a9119e2e168d7faed97b821b4f584bf72a62dddb462abab50c02ea16074fd7","observation_id":"a4826869-d6d3-49e4-adbe-945c7e9bd8b8","resolution":{"observed_at":"2026-05-19T09:02:14.552122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05175","last_updated":"2025-06-30T22:16:39Z","snapshot_observed_at":"2026-08-01T08:08:15.221032Z","submitted_at":"2023-10-08T14:22:58Z","title":"Outlier Weighed Layerwise Sparsity (OWL): A Missing Secret Sauce for Pruning LLMs to High Sparsity","version":4},"cited_work":{"arxiv_id":"2310.05175","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.05175","snapshot_observed_at":"2026-07-02T11:36:55.495533Z","title":"Outlier weighed layerwise sparsity (owl): A missing secret sauce for pruning llms to high sparsity","venue":null,"work_id":"30830665-b77d-4751-98dd-78af4465c909","year":2023},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"cited_paper":"/paper/2310.05175","citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:d037e3d22d0ea1fa64553fcc6d86d4a659990d3bf42e9521fe233c851cd23a3d","observation_id":"1bec7733-1361-4ff9-ad4c-546b2a85b73f","resolution":{"observed_at":"2026-05-19T09:02:14.387859Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18403","last_updated":"2024-08-07T03:30:30Z","snapshot_observed_at":"2026-08-06T07:29:40.859648Z","submitted_at":"2023-05-28T15:15:48Z","title":"LoRAPrune: Structured Pruning Meets Low-Rank Parameter-Efficient Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2305.18403","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.18403","snapshot_observed_at":"2026-07-09T07:16:04.188505Z","title":"Loraprune: Structured pruning meets low-rank parameter-efficient fine-tuning","venue":"cs.LG","work_id":"45ca4092-5bb4-47ea-8556-44f2eaa2a427","year":2023},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"cited_paper":"/paper/2305.18403","citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:73344d18051ca1eed36799bde2f6ccb2d12d44843145881bd4a58d6f510be155","observation_id":"e5d46116-a700-4821-9c58-317345c79fdf","resolution":{"observed_at":"2026-05-19T09:02:14.375780Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06275","last_updated":"2024-05-10T07:05:02Z","snapshot_observed_at":"2026-08-04T19:21:30.011649Z","submitted_at":"2024-05-10T07:05:02Z","title":"Pruning as a Domain-specific LLM Extractor","version":1},"cited_work":{"arxiv_id":"2405.06275","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.06275","snapshot_observed_at":"2026-07-03T01:07:30.198807Z","title":"Pruning as a domain-specific llm extractor","venue":null,"work_id":"bccb39f3-9734-4405-8b4b-f9010810d628","year":2024},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"cited_paper":"/paper/2405.06275","citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:8cb3c84aa375d91a547db702470361055b2b448ce70b9ba74a782de1edaea7bf","observation_id":"1a547d06-e3b0-44bc-bbb5-8e2bdb0af8b5","resolution":{"observed_at":"2026-05-19T09:02:14.381972Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12200","last_updated":"2024-06-04T06:39:23Z","snapshot_observed_at":"2026-07-06T17:18:56.465394Z","submitted_at":"2024-01-22T18:39:40Z","title":"APT: Adaptive Pruning and Tuning Pretrained Language Models for Efficient Training and Inference","version":2},"cited_work":{"arxiv_id":"2401.12200","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.12200","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Apt: Adaptive pruning and tuning pretrained language models for efficient training and inference","venue":null,"work_id":"693a2061-c64c-4d95-81da-9351597fd2b2","year":null},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"cited_paper":"/paper/2401.12200","citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:d457abf14ceca7a64f104bd502c207f76641d5756767ed6e053d2754848cc83a","observation_id":"aee10fc1-99f2-4a51-8972-51ec7728b6b9","resolution":{"observed_at":"2026-05-19T09:02:14.522226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.04010","last_updated":"2021-04-18T10:18:00Z","snapshot_observed_at":"2026-08-04T18:04:45.224844Z","submitted_at":"2021-02-08T05:55:47Z","title":"Learning N:M Fine-grained Structured Sparse Neural Networks From Scratch","version":2},"cited_work":{"arxiv_id":"2102.04010","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.04010","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning n: m fine-grained structured sparse neural networks from scratch","venue":null,"work_id":"dc8e61ef-f3eb-4c09-a94a-79ea3e900f5c","year":2021},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"cited_paper":"/paper/2102.04010","citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:79f8b72f9624480bac027bfd047ca77a2e04f71569b00ac86f40cbbd5520fcbf","observation_id":"8b521e1b-059c-4494-a251-aecb8bbc2a7a","resolution":{"observed_at":"2026-05-19T09:02:14.545469Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"cited_work":{"arxiv_id":"2404.14294","doi":"10.48550/arxiv.2404.14294","metadata_source":"pith","pith_arxiv_id":"2404.14294","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on Efficient Inference for Large Language Models","venue":"cs.CL","work_id":"4e58b7d0-2870-4ddb-955f-798b34deb447","year":2024},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"cited_paper":"/paper/2404.14294","citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:cb9d65208e1356bbc4d7d760d1737f81a404cd59dfd95c649c0126570788f407","observation_id":"4471b47c-5dea-412a-a350-02f619e59392","resolution":{"observed_at":"2026-05-19T09:02:14.368980Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:38.535897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:38.535897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"0 2000 4000 6000 8000 10000 Iteration 0.5 0.4 0.3 0.2 0.1 0.0 f(mt w, ) f(m0 w, ) Train with 1 Sample (a) Training set =","venue":null,"work_id":"d6f53612-14f6-4044-8bd5-544672ac3197","year":2000},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:292499d2678af0bd98bf281fac02aba35e91f369f076ddcc08881f39f95fec66","observation_id":"c24e6127-b66a-4e3f-9b09-c487d76fd08c","resolution":{"observed_at":"2026-05-19T09:02:15.318129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ecc58afb-d4f7-4ad1-99b9-e0cfedf43d1b","year":2000},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:3231c3df622677ca9d6a10b134c57c5ddc5d9bec3b3178c56b56b2e092d8f5ad","observation_id":"093589cb-b717-4d86-8b24-76a8b00483c2","resolution":{"observed_at":"2026-05-19T09:02:15.314085Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f97c06ae-e061-4bae-8d72-6d8f36fb15f4","year":2000},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:3e35fee9debfc41480633cabe65ed0063c90d2843f68fa8304a08510f84d8cdb","observation_id":"0ddf2fd8-5a0b-4ebd-818a-dd91be01bfaa","resolution":{"observed_at":"2026-05-19T09:02:15.321817Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Figure 5: Loss residual curves of training on LLaMA-2-7B model with 1, 32, 128, and 320k samples","venue":null,"work_id":"ac6dd5ba-a1fb-4ef0-bd8a-a807a5532022","year":2000},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:97483733825be782ac25ef143464aee42b38b0edb85e86d0b42433bca14fde5e","observation_id":"3a484256-1522-40cd-9b2c-e38eb5df94f0","resolution":{"observed_at":"2026-05-19T09:02:15.325633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The MaskLLM method suffers from severe memory explosion and exceeds the memory limitation of 8× A100 GPUs (> 640 G)","venue":null,"work_id":"a598e36a-7ccb-47a9-8f75-84ec78fe7377","year":2000},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:4e3c0198ce731af24080b088b2aace3c1f41ffd7c9d9e06c6692c28bd9e4c79b","observation_id":"d00f1756-82b6-49a0-8d0d-6e89cf87ac14","resolution":{"observed_at":"2026-05-19T09:02:15.305044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Similarly, letting δ = 0, it degrades to the update with only loss residual, which is also a unbiased estimator of the standard policy gradient","venue":null,"work_id":"a64144c4-aef7-456e-a266-458aa2bebd4f","year":1992},"citing_paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-19T09:01:16.991413Z"},"links":{"citing_paper":"/paper/2506.12876"},"observation_digest":"sha256:37021726d3599d6fe991450ac06a96b192bf3feb90dc370eb281b9f08bf23f51","observation_id":"297d6eb4-d07e-4d33-84f3-1242c6d30cfe","resolution":{"observed_at":"2026-05-19T09:02:15.309160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.12876","last_updated":"2026-05-13T04:56:46Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-01T16:23:25.586402Z","submitted_at":"2025-06-15T15:02:59Z","title":"MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":7,"parse_uncertain":0,"unresolved":2,"verified_exact":23,"verified_fuzzy":5},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 1 inbound Pith citation observation for arXiv:2506.12876."}