{"as_of":"2026-08-05T22:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:463d6f2c93de8a4c693cef5ca2205e2125342b1f78cd3069246bde8df28c9507","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T17:02:30.894934Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T08:00:57.256732Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.09080","snapshot_observed_at":"2026-07-31T08:00:57.256732Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28418","last_updated":"2026-07-30T16:01:03Z","snapshot_observed_at":"2026-08-03T09:58:44.302667Z","submitted_at":"2026-07-30T16:01:03Z","title":"WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-07-31T08:00:57.256732Z"},"links":{"cited_paper":"/paper/2606.09080","citing_paper":"/paper/2607.28418"},"observation_digest":"sha256:1fb0e0ce5beaa33d3d3fd3e27ec65f1aa57c200672cc4c2e6ad718c33ddfabd8","observation_id":"0eab88f6-d7a0-44b4-af9a-40fc86ba8dc1","resolution":{"observed_at":"2026-07-31T08:00:57.256732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.09080/citation-record","integrity":"/paper/2606.09080/integrity","json":"/paper/2606.09080/citation-record.json","paper":"/paper/2606.09080"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":"A Deeper Look at Depth Pruning of","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:4dc8ab3fedf80b8350daff52496ad3330c76a928f89ebca530305d4298c2d330","observation_id":"8783605d-19ea-4427-9ffc-c4aaf8f94493","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.emnlp-main.955","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V isi P runer: Decoding Discontinuous Cross-Modal Dynamics for Efficient Multimodal LLM s","venue":null,"work_id":"2a5e97ab-d5a5-432d-92bd-63362f5f5331","year":2025},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:e9a73914a6ccfe6ee036dabbe27dde296214ca39a6fde99c50e0582c4966c862","observation_id":"de5b5d27-1d7b-4d51-b29e-69eec0c6cae3","resolution":{"observed_at":"2026-06-27T17:11:05.744198Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:b026bd6dc05f284fb77ac16a91163bed5af44c978d95205cfcd6aa48c68b33e4","observation_id":"b9fbb85d-c413-4312-bfff-6abdd700f1a6","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:b5c53df39a7141522de6da9b0fc8d6c1222edeca5767a39b3f23904de973b353","observation_id":"2f11002f-4650-45fb-9a05-9e33b9ff5069","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:66fe1e8b952d533e42713ebac4e6f832ed8d56fdb197459003fb2423ebdd4fb3","observation_id":"8b879f8a-f1d6-4ea7-b22f-11659bb255f0","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:b423ba90ae9ccab8246a17094fd431946c0b6bcf5383248f4b27aabac9bde363","observation_id":"c9cb7c60-71f2-432c-9569-ccf1b83cd1a5","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:1201b0c943cb41ee6ccfb74dde9ae539f8f82dc22942bb8125140b252154ee5b","observation_id":"d2f842d4-a061-4e05-b439-391fa8fad85f","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":"A Survey on Deep Neural Network Pruning: Taxonomy, Comparison, Analysis, and Recommendations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:b493395427178dd948ad996a657999029cf7f566b46cc7a82782cfa578cdea74","observation_id":"9a1947a6-af24-42f5-84d2-8904b204747c","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"cited_work":{"arxiv_id":"2404.14294","doi":"10.48550/arxiv.2404.14294","metadata_source":"pith","pith_arxiv_id":"2404.14294","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on Efficient Inference for Large Language Models","venue":"cs.CL","work_id":"4e58b7d0-2870-4ddb-955f-798b34deb447","year":2024},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"cited_paper":"/paper/2404.14294","citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:ae5ec4a333ed198e6302b036b4af9389d14928adf3ab039f61dc6640720107b7","observation_id":"d1ef2fcd-5187-423c-88cc-b87f68175912","resolution":{"observed_at":"2026-06-27T17:11:05.747375Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:38.535897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:38.535897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02258","last_updated":"2024-04-02T19:28:11Z","snapshot_observed_at":"2026-07-06T17:54:47.689340Z","submitted_at":"2024-04-02T19:28:11Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","version":1},"cited_work":{"arxiv_id":"2404.02258","doi":"10.48550/arxiv.2404.02258","metadata_source":"pith","pith_arxiv_id":"2404.02258","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","venue":"cs.LG","work_id":"6dcdd707-a37b-49a9-9531-4fc6f5b9ed84","year":2024},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"cited_paper":"/paper/2404.02258","citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:77f43fe6f9487ee15886cbe4f86aae214121a17e520bb0706f2f6c256f711625","observation_id":"ba36a10c-bb6c-4724-80a4-ed517f74857e","resolution":{"observed_at":"2026-06-27T17:11:05.742050Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":"Forty-Second","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:1dac49896415a55013cf9ca22e645da7790ced49b4c5e83ba5f08ee9b8166331","observation_id":"c0cabbab-a57f-415c-b933-72ef86a254fe","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.findings-acl.1035","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ShortGPT: Layers in large language models are more redundant than you expect","venue":null,"work_id":"b7f3d3e4-5ce2-47a0-9148-f14ba9ae840c","year":2025},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:b83586c9f3b7f95bfd29247a65a34f1d612bca47ecbb3f231168be0ca8c8a623","observation_id":"17badc65-825f-4f6e-ae3e-3b20b32e5490","resolution":{"observed_at":"2026-06-27T17:11:05.731389Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-17T23:20:58.119671+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-17T23:20:58.119671+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":"Findings of the","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:5d481699781a5613722da16f1eecbcc4113477586c3a790e6b01bee3f8b2728a","observation_id":"275aa7b1-8a36-4231-bc2c-6b6ccf9bca99","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15921","last_updated":"2025-04-23T23:24:01Z","snapshot_observed_at":"2026-08-04T07:02:39.018938Z","submitted_at":"2024-12-20T14:13:09Z","title":"Less is More: Towards Green Code Large Language Models via Unified Structural Pruning","version":2},"cited_work":{"arxiv_id":"2412.15921","doi":"10.48550/arxiv.2412.15921","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15921","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"arXiv (Cornell University)","work_id":"f082e7ed-55e9-45a7-ad94-4b555ab3a1f5","year":2025},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"cited_paper":"/paper/2412.15921","citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:af577fe3265b81346c4457e65a658ed470eb3f933688a527d23422eeb55bbe35","observation_id":"84c4bc9e-109a-40ae-853e-897eeb02ff08","resolution":{"observed_at":"2026-06-27T17:11:05.739497Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09949","last_updated":"2025-01-17T04:24:31Z","snapshot_observed_at":"2026-08-04T09:37:01.567968Z","submitted_at":"2025-01-17T04:24:31Z","title":"MultiPruner: Balanced Structure Removal in Foundation Models","version":1},"cited_work":{"arxiv_id":"2501.09949","doi":"10.48550/arxiv.2501.09949","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.09949","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"doi:10.48550/arXiv.2501.09949 , archiveprefix =","venue":"ArXiv.org","work_id":"20d6f397-8967-4e8e-9905-78f06289d58f","year":null},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"cited_paper":"/paper/2501.09949","citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:343994c51c7d99f06a15a0fc42966a7b97b8fbb3487405c71e4e22340c21920b","observation_id":"b0d29c0c-4b70-4e9c-b55a-6ddfb3d18aa7","resolution":{"observed_at":"2026-06-27T17:11:05.729367Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10285","last_updated":"2023-09-19T03:20:02Z","snapshot_observed_at":"2026-08-01T16:15:23.171765Z","submitted_at":"2023-09-19T03:20:02Z","title":"Flash-LLM: Enabling Cost-Effective and Highly-Efficient Large Generative Model Inference with Unstructured Sparsity","version":1},"cited_work":{"arxiv_id":"2309.10285","doi":"10.48550/arxiv.2309.10285","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.10285","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flash-llm: Enabling cost-effective and highly-efficient large generative model inference with unstructured sparsity","venue":"arXiv (Cornell University)","work_id":"7dad54d7-b04e-46f6-a691-73a220bcd3d9","year":2023},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"cited_paper":"/paper/2309.10285","citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:c130ddcef874035ff2a3a34f1680de01edaff0e75d1750685e4b131d888e0eb9","observation_id":"cdefe15b-5862-4af1-942a-d27eade948f5","resolution":{"observed_at":"2026-06-27T17:11:05.718176Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":"Efficient","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:10b530b35233cf376a41c8ceea8a6cf33ff3d8535b4f62736d2bdcd32daf7aa7","observation_id":"2828d1fd-c1dc-4657-a7cd-c2c0feeb28ff","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":"and do Nascimento, Marcelo Gennari and Hoefler, Torsten and Hensman, James , year = 2023, month = oct, langid =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:fd4b880ae4cd99928b135193485db9c7914be619ee749b5a790f1164956ca32c","observation_id":"6b465e38-2965-4947-bac9-9a1054e87cb6","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":"Thirty-Seventh","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:3baacb8ad290eb8a503988247543f4300d8fd6e915b41da3f4b7e5fe9ca4df5d","observation_id":"abc7e229-8f1b-4c6b-8e99-e5ba17ba664b","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:96e2dc65df60ed2829634f92e6709159dc32c0fa4f4951c5ee44a5acc4e2061d","observation_id":"13555b09-9dcc-4d53-aa41-9f72109937b8","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.09657","doi":"10.48550/arxiv.2503.09657","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.09657 , year=","venue":"ArXiv.org","work_id":"486a6262-b3bc-480c-8100-5ab876035384","year":2025},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:8d44c80f0b7ce0f172bde39030aa62f55b5be61bca24ce17d786801d8f795fe6","observation_id":"4501e253-9469-4716-b7e5-91172e0ccc03","resolution":{"observed_at":"2026-06-27T17:11:05.711516Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.03801","doi":"10.48550/arxiv.2505.03801","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"arXiv (Cornell University)","work_id":"89b009b3-f367-4c1b-bac0-46b4c9305698","year":2025},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:ba76d9aed0af27f5f2f01d240aae46ff219269e1e7318bd64ac9a734568b30b2","observation_id":"f1225104-a479-4adc-ac84-cd75d72aa7aa","resolution":{"observed_at":"2026-06-27T17:11:05.686954Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:e971940dd1b3b10ed5002f7bcdd27cae0fdb1f500fc02a7fbf71fbff485371f0","observation_id":"aa8fb56b-a7de-4827-b08b-86e083e06b31","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":"Proceedings of the 40th","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:5b8ac022d1565b74e2bad7d04579be612b40c3e2d84be0733e54cace6751eaa8","observation_id":"cb43ce00-2dc7-48f6-a595-172b0d292c69","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":"Zico , year = 2023, month = oct, langid =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:13c60248c9a27a669c16b00b4ae6f6cb861dcaddca1a02ca9b09a1dec557579b","observation_id":"7c851539-8b1b-46bb-98fd-1598d1b7ff71","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:6f0776bdc0d72ddef03a2fdaa9d921b3b8fb859e681b0003b20b73e52ea1c3c3","observation_id":"b806d1f4-0a01-4e44-82ec-ee543db4bb41","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":"Prompt-Based","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:743f8da804fc177356a80544260d0da5af37751db59b30d484360d7762c77d16","observation_id":"eed05c60-e511-4364-9cef-9674d7cfd015","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:7dc64c29b69f549c1dfc380131af4fb9c90cd753b45ac16c296bbb9b20aa0426","observation_id":"b95c5a78-460d-4c9f-a925-a46f99c932c6","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:2808f1bd82cdac19d475d621f0ffb23756bec5150ef05452696348d37bc7af7b","observation_id":"11a8c357-df10-4682-bf4f-a0fbbaf4da1e","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.12087","last_updated":"2026-04-28T06:58:25Z","snapshot_observed_at":"2026-07-06T22:38:54.914862Z","submitted_at":"2025-12-12T23:30:43Z","title":"BLASST: Dynamic BLocked Attention Sparsity via Softmax Thresholding","version":3},"cited_work":{"arxiv_id":"2512.12087","doi":"10.48550/arxiv.2512.12087","metadata_source":"pith","pith_arxiv_id":"2512.12087","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"BLASST: Dynamic BLocked Attention Sparsity via Softmax Thresholding","venue":"cs.CL","work_id":"f8235a9e-3a00-45d0-a9a9-4f26273f82f4","year":2025},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"cited_paper":"/paper/2512.12087","citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:0a79cae6cc850fee0bc010dcb6e27b703f54e1b62aa08bd0b4cfa2aff0c57579","observation_id":"41288731-b927-4803-ab16-29cdfb9b73bf","resolution":{"observed_at":"2026-06-27T17:11:05.692659Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.19595","doi":"10.48550/arxiv.2507.19595","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient attention mechanisms for large language models: A survey","venue":"Open MIND","work_id":"3dee237c-3b7e-46c4-a234-67b9bed9b5f1","year":2026},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:f8a392efa4ae165f363071dfd5985ae7927506f07f965f2525a6816fe03bf3cc","observation_id":"cda5dc46-fd2f-429b-b1ae-91a3a90a19f6","resolution":{"observed_at":"2026-06-27T17:11:05.721112Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:78052ff128d986f7d29a94f5918b252705f4f118d1076f4dc366160617ce353d","observation_id":"ea86ba86-9faf-4c66-97a1-ed85412abfd5","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":"Forty-Second","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:2f186a655661de9acb294cb464e6355c686ddc8edc4a0112bee64c230c8c0586","observation_id":"acbc2a59-5538-4655-b371-285df55c6ae0","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-05T22:17:49.177780Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":"2303.18223","doi":"10.18653/v1/d16-1080","metadata_source":"pith","pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey of Large Language Models","venue":"cs.CL","work_id":"de1b42b5-4a0a-4b1f-8c78-1f7fe21be6c9","year":2023},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:5968c86d969204f78f630edafe77e3aff3e10ce7fd49a2378ef9fa06135bb783","observation_id":"6c4209ae-fede-44b8-8282-b62f093eec0c","resolution":{"observed_at":"2026-06-27T17:11:05.698930Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":"2602.02276","doi":"10.48550/arxiv.2602.02276","metadata_source":"pith","pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi K2.5: Visual Agentic Intelligence","venue":"cs.CL","work_id":"d690be8f-5d53-49b0-b1e7-79668eb8fcdb","year":2026},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:f713ec2f31dc37d85e2641948857ae29f49f185843f8ccc442a536675ccc857d","observation_id":"2875f540-9ce2-4553-b32b-6c5a12781d87","resolution":{"observed_at":"2026-06-27T17:11:05.704357Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.21148","doi":"10.48550/arxiv.2508.21148","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A survey of scientific large language models: From data foundations to agent frontiers","venue":"ArXiv.org","work_id":"eaab8ad1-7342-402b-a544-86fb0dbbf330","year":2025},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:aceb45672a013b98b6fdc7d405f9da30b9f26a5fb13f616d6542a21339549a62","observation_id":"697f0eca-b0e9-4a95-baac-11bb9e77dca2","resolution":{"observed_at":"2026-06-27T17:11:05.701705Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:44c2006f6bac6e87a1621dc38b5266d5a23e665a59b90fc4b071d8cd58727fec","observation_id":"6918d03b-d60f-4c51-9979-55617cbe470e","resolution":{"observed_at":"2026-06-27T17:11:05.710367Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:b07f247b10a9caf185d4a7ab4137ab0c1291b35b517c5fe41acf30edd5b460f4","observation_id":"5c7f8f31-68f9-495d-8fec-bc315910deef","resolution":{"observed_at":"2026-06-27T17:11:05.696063Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.25602","doi":"10.48550/arxiv.2510.25602","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Int vs fp: A comprehensive study of fine-grained low-bit quantization formats","venue":"arXiv (Cornell University)","work_id":"fa84c298-86d9-4873-aacd-caace7e48d5d","year":2025},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:1468dded410e747ef33966d377a930249811bf74c7b5347f7f673b3bcc9424b6","observation_id":"bdc9e7dc-610f-48b6-b142-be9a602932f4","resolution":{"observed_at":"2026-06-27T17:11:05.689953Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15786","last_updated":"2024-10-17T02:43:35Z","snapshot_observed_at":"2026-08-03T10:43:35.890260Z","submitted_at":"2024-06-22T08:41:48Z","title":"What Matters in Transformers? Not All Attention is Needed","version":6},"cited_work":{"arxiv_id":"2406.15786","doi":"10.48550/arxiv.2406.15786","metadata_source":"pith","pith_arxiv_id":"2406.15786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What mat- ters in transformers? not all attention is needed","venue":"cs.LG","work_id":"69c01fcb-42c6-4882-af20-b387b01f3f88","year":2024},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"cited_paper":"/paper/2406.15786","citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:d93eec21779abea5aacb587b2d0ffeea8f6d42b104ec38938c22362b467a5f2f","observation_id":"be78f15b-4499-4105-8cfc-abc452af05bf","resolution":{"observed_at":"2026-06-27T17:11:05.719166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5508.332997","doi":"10.1145/3315508.3329973","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"T., and Cox, D","venue":null,"work_id":"36502ac3-807e-4ab8-ac44-c87017160e32","year":2019},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:872735ae562c56fbed40532487b4960d915ebe189e708da9072af00ccfe2078b","observation_id":"49bcd43b-a40e-4fbc-900f-aed73f7be525","resolution":{"observed_at":"2026-06-27T17:11:05.736767Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:49:01.192843+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:49:01.192843+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.findings-acl.262","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"B lock P runer: Fine-grained Pruning for Large Language Models","venue":null,"work_id":"f38deb65-b7fc-4125-8276-9b8948f3a432","year":2025},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:c8a44e03ba65da54591dfcadc69062106b8de6af61a7fe0959ef3b39916b5806","observation_id":"bf44697e-bde7-46d0-ba20-1691a6e53b75","resolution":{"observed_at":"2026-06-27T17:11:05.723516Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-17T23:20:55.085992+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-17T23:20:55.085992+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:0e30747bdb974dcd5e8d9424c9bd1474c482a3244b37c95f28ca3d1b4b3c779b","observation_id":"a2b39285-10d9-4d16-abe8-9ae8b345e9de","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:561a7e01ce0bef081275afe5b8bf0bdfa86d1c4ad6a70d602e032c32b5084c72","observation_id":"8f79c042-9072-46f4-bce0-60af6340ecdb","resolution":{"observed_at":"2026-06-27T17:11:05.728245Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:73ab2cbe3e254d91a9121e2aaab28c406dbd91baa6705c057e8970c32ecfd7d5","observation_id":"7e61f776-9bb7-47ad-9685-58d369709c50","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:58eb505b83d7f1cd7e745c4d0ab271440d42f571f17cdd48a8ded4cfe0edb6cb","observation_id":"cc47ff91-6408-4755-b24c-0a84db218b39","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:7c05d417df00ecb651e251b1c84a327efc4d6aef0da6a72d36e8f4cdcbf77d6e","observation_id":"f3822e68-3b4e-463f-ad87-9354df9aa08b","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.09946","doi":"10.48550/arxiv.2512.09946","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"doi:10.48550/arXiv.2512.09946 , archiveprefix =","venue":"ArXiv.org","work_id":"4f7a7b77-fa7a-4590-a13e-e6263ef2a5ee","year":2025},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:248691c324b845327162530b4d91222a75ea5ec3325cbfbb2c3561375e2676e8","observation_id":"2e7c57b3-d875-4441-a5e1-64245bf1fd95","resolution":{"observed_at":"2026-06-27T17:11:05.730689Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":"Pruning as a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:75f695f429bd284eb5b4b717c64f22e6fb23f0799042b4f58cb90a34e35aa812","observation_id":"3c7d1934-4b1b-4da0-8885-4c6815a02e8b","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02834","last_updated":"2024-06-23T08:45:33Z","snapshot_observed_at":"2026-07-06T17:25:18.238343Z","submitted_at":"2024-02-05T09:44:49Z","title":"Shortened LLaMA: Depth Pruning for Large Language Models with Comparison of Retraining Methods","version":2},"cited_work":{"arxiv_id":"2402.02834","doi":"10.48550/arxiv.2402.02834","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.02834","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2402.02834 , volume=","venue":"arXiv (Cornell University)","work_id":"4c40e3b8-e525-4a77-9650-98e2f999bb7a","year":2024},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"cited_paper":"/paper/2402.02834","citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:545815a4e9f739afc1219ce16adc52aa0bca12c4fce3aaccb7cbba096bddc012","observation_id":"1e20dc23-b4c5-4281-8382-2b0e2038482a","resolution":{"observed_at":"2026-06-27T17:11:05.721871Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:69b0ca3bb91e02643c123bb79c81dcfc61fa0dd4f1bcee1bebb416a46305fcb1","observation_id":"041beb61-d001-4d66-9b0e-e0df04ce510b","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:56cdf18698b63d3d17abc8d36b2d505c7cedafd6ef668f5e38c24098fd1a4e5b","observation_id":"0494ec53-2d1e-4e92-b7c4-c7068b9710bc","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":"and Shen, Yelong and Wallis, Phillip and","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:81671690b1b382be920ceaed1628c122a89988c67473bd3c65b6fe64b04f69b3","observation_id":"30de5802-2670-4e62-b99d-24638f747198","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":"Fluctuation-Based","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:9358da03e114dce072bb59422744fde4dc6bc0dc1542aeed00d110710b50203e","observation_id":"58f6ec90-4037-46a0-9c1a-045bcac9556c","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":"arXiv.org , howpublished =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:57e3bc52bff45e7a28ed2d74443849522cfc31799afe128250ae008aa512ff9f","observation_id":"76abf642-63b2-44fe-9b82-dd79686ed455","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:7882272a1f6987848710809c1e00584c791760e800a080f2a3b9dcc0ce177279","observation_id":"21ade274-e612-49a2-9f64-dbccceaacb97","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:aaa692067b6b2f6534ca7b5d1d22ded2a86f9ae283dba3d2686b6b3ce6966bfb","observation_id":"b41af558-4887-45cd-ae4a-e366127ecc13","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04466","last_updated":"2025-06-13T12:20:54Z","snapshot_observed_at":"2026-08-02T03:13:11.983917Z","submitted_at":"2024-10-06T12:42:04Z","title":"Large Language Model Inference Acceleration: A Comprehensive Hardware Perspective","version":4},"cited_work":{"arxiv_id":"2410.04466","doi":"10.48550/arxiv.2410.04466","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.04466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large language model inference acceleration: A comprehen- sive hardware perspective.arXiv preprint arXiv:2410.04466","venue":"arXiv (Cornell University)","work_id":"3668d91c-87e9-4c03-93d2-77fcd57e80ca","year":2024},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"cited_paper":"/paper/2410.04466","citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:b2940aad4789c771b0c1541908e590ac4eeb7c6c6fcc30a15e33ca4f5168f8d3","observation_id":"da4f2d62-68cf-4dd7-a7ca-e00f77d5f5b9","resolution":{"observed_at":"2026-06-27T17:11:05.707747Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.12608602","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T04:46:45.648157Z","title":"doi:10.5281/zenodo.12608602 , url =","venue":"Zenodo (CERN European Organization for Nuclear Research)","work_id":"2c57f331-c45e-4b28-9887-1931db7da39f","year":2024},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:78e7da6f87810b1eb1760af8f55e732871ccea5bae79fe78bc0e088f9b03d2df","observation_id":"8099956c-c11a-4163-88c5-888fc68c228d","resolution":{"observed_at":"2026-06-27T17:11:05.723738Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T09:08:05.232771+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T09:08:05.232771+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":"1609.07843","doi":"10.1007/978-3-030-62077-6","metadata_source":"pith","pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pointer Sentinel Mixture Models","venue":"cs.CL","work_id":"fef3833e-dc80-42a3-a1e0-ffbfafee6fff","year":2016},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:caa91755d02f480d526f281417cb80f4a646d729ae8edd561cc82342eae9ebbe","observation_id":"d35400c8-c124-4bba-8c7a-0a005f247639","resolution":{"observed_at":"2026-07-03T00:47:30.322509Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:4b5f5d7b4bef7c45dfeb6aa1908fa9282945eb41b9385d815392dc93838339f7","observation_id":"c7af06e7-606c-443d-8c42-29f798c0fbd4","resolution":{"observed_at":"2026-07-03T00:47:30.335240Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":"1905.10044","doi":"10.48550/arxiv.1905.10044","metadata_source":"pith","pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","venue":"cs.CL","work_id":"511eeb84-4b95-46d5-b14f-50da43f4f19f","year":2019},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:3f8402707c7fcf2a5875cb25c472b84f4d1200e9a60ce7a3c2436842980c1ca2","observation_id":"009fd7da-e152-4001-b8bd-1aadff0e4700","resolution":{"observed_at":"2026-07-03T00:47:30.331155Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":"Proceedings of the AAAI conference on artificial intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:329be1dcb4301f18b7330095a1a444d5070cb3c7c52c4934cb39e147af336f3d","observation_id":"ea425325-d71a-419e-8183-0abcbbe5973c","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":"1905.07830","doi":"10.48550/arxiv.1905.07830","metadata_source":"pith","pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","venue":"cs.CL","work_id":"79f44c0c-96f4-4edb-bc50-a3c9d6b85936","year":2019},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:1f84b60fddab5af70afd9a33385df0bf15dd01dc3e3838825484d93925e7446d","observation_id":"7686e2fe-c4ab-4d57-9788-8184fc7db84d","resolution":{"observed_at":"2026-07-03T00:47:30.338207Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":"Communications of the ACM , volume=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:26fa191e09ab2285294e65cc47e1ef3101b13d4e8e05aa087cdb002f0daf289a","observation_id":"7a5bd771-d3e8-4cc3-b9a7-4321826b980b","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02789","last_updated":"2018-09-08T11:47:16Z","snapshot_observed_at":"2026-07-06T06:59:57.168051Z","submitted_at":"2018-09-08T11:47:16Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","version":1},"cited_work":{"arxiv_id":"1809.02789","doi":"10.48550/arxiv.1809.02789","metadata_source":"pith","pith_arxiv_id":"1809.02789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","venue":"cs.CL","work_id":"b9d68fc0-5b23-4def-bc5e-6ad71d64eec6","year":2018},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"cited_paper":"/paper/1809.02789","citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:8f1497acc301a67bada0881f022ebffb1e09221ddcf764456b7d38d45a2bc234","observation_id":"3ff8f937-c4ac-47db-9c91-ab5b59053f0b","resolution":{"observed_at":"2026-07-03T00:47:30.327288Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:d9043111ecaf11e596f3c85e799b6b0ca7a6a01050e9d6eba1a6a3c088395f82","observation_id":"cdaf0ffa-2dd0-4d6a-938e-f5425b47ea38","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.23734","doi":"10.48550/arxiv.2602.23734","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Utptrack: Towards simple and unified token pruning for visual tracking","venue":"Open MIND","work_id":"7de4050f-4c34-4799-9a40-345d62aa1703","year":2026},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:84a5c00e4dd42dc549b07e89d610cf19e6614f3eeecca9d0788bb1a40c2143c4","observation_id":"2fe44297-84c4-4251-aea0-8bb23138e7be","resolution":{"observed_at":"2026-06-27T17:11:05.726523Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0375.554951","doi":"10.36227/techrxiv.177220375.55495124/v1","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Data to Model: A Survey of the Compression Lifecycle in MLLMs , url=","venue":null,"work_id":"42309928-0f4b-45af-b533-69baf5f52377","year":null},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:7055d3a6a346d985ef4b171ded935eea991f6cafbeed933c35fe297635565cc3","observation_id":"2e16b766-b2e4-44b0-92c6-bad5ebd4c51d","resolution":{"observed_at":"2026-06-27T17:11:05.734110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:30.894934Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:770920aa6ae58b10f2630ef7f851b92b2228ac4220206df249b21b018b03a6d2","observation_id":"50933117-11b6-4df4-9c3a-4739228a6881","resolution":{"observed_at":"2026-06-27T17:02:30.894934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":12,"parse_uncertain":0,"unresolved":38,"verified_exact":20,"verified_fuzzy":0},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 1 inbound Pith citation observation for arXiv:2606.09080."}