{"as_of":"2026-08-07T20:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:87dff1258d5bb9e03139ca2429699def51302dc9d51db95050d9d5ba68b2d95f","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T07:32:31.866525Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.08786/citation-record","integrity":"/paper/2607.08786/integrity","json":"/paper/2607.08786/citation-record.json","paper":"/paper/2607.08786"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:bf167d62b854a0d8c256555744715c047d5a71a89bfbe8b5ec2b662d27f4eb5f","observation_id":"d0cf5530-4100-403f-bd8c-2b131fc5cd17","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-06T08:05:35.311510Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:ee261e0f008ca7bbd63db96f2d6b138c22ca985ed588f5821748676ad8ce22a4","observation_id":"039d512b-42fc-4446-817b-9e2370ce73dc","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:c6543eb36ed4dd5d4ddaefe7612500c1c36c730669a7b60d18d378afc1a466d8","observation_id":"5fd17147-2199-44de-8f7e-84a5925b2ad3","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:31dc37a3f395d282833aaf93aa8652f68608a344448e1261f84bc17575a85a7e","observation_id":"cd4f4e3c-6cc1-47cb-975e-34bd23595af7","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:64f35a081c61241d61ac480117e1f83967b9426406acaceff7a54c8d19ebe2cb","observation_id":"cb61c7cd-d7dd-430d-892e-b9c55b6130be","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:594f1753253b36de93895064f9467a87ac62d4915245d392da8a44895ce226cc","observation_id":"47b9df60-e9fe-47bc-874e-fe0027c757b4","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:5802767961cd5ce59169b44f07d1ac9bcec868137cd24f4e59a38d7e6e7edf71","observation_id":"ddd8af86-96da-48c2-b56d-eb3091028c81","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:87d9cd09a97cf8f724f2c6f0a658d547bd3b5bd58caf03cc6bbbf645c287f047","observation_id":"105be52d-c7df-4a21-bf80-156c38594128","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:e8d0dbe750622610a1ce18a6d5484364bd898ed00fc16b1ee4deb92a564d7321","observation_id":"03d2457e-03a1-43b7-a64b-8607a4754edf","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:838c3d04ad3b4e392f5dd96a8b5f7fc3469bb5c3e6649ad71052cb996eb05b2c","observation_id":"429f24c8-b477-4ee0-9925-715fc41c819a","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:8a203d672ed1b10e16b10ebad7e76b34e6ab3620184cbdc1cfdca455e348a2dd","observation_id":"d7fa3c7e-523f-4d69-b8bd-73e9b7ce2917","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:df82d263a43e3e5817005b643d0fde67e6ebd0587b3d0ea462942b9895951b85","observation_id":"633c8c4b-4aa6-4e06-b7f7-cdc386e3999d","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:912a96d96875769d4401d36410ba528b07030b02ef706beb1fe7c8f58bbcbbd9","observation_id":"8da298ec-cafa-4b43-a64e-999b194a603b","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:424b8b3cedd4f4b924e4a304cebc11b9d5844ef6ca13d6720b4982fb6195f21b","observation_id":"88f6543f-573f-4729-ac8c-e9ecfcf5157b","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:e35ad434feabf0864c457de046375cd494a0af61bbbca4ee5e845bc24fa2fc68","observation_id":"73ab3e9f-866c-40ec-8401-97cc9dedcce7","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:7605a2d11fa8dc6813a19d79d625590f4576b857caf2c671241dafa73c4d6e61","observation_id":"6d0ddaef-192f-4af9-846f-78a5c166523c","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:91fe66f7339c85162fb4ec0b69822d9e73efadbfd4c8111d19f307e09fd802f0","observation_id":"e68baf3f-8c0a-405c-baf1-c58c66589486","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:811d87a5bbdb2dcbe629ecbe5206b54d5c4f99f0ff421d1ed516d619204db7ab","observation_id":"8bca3f89-e262-4dcb-96a1-d62d44d93393","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:3c6f44d8200ab136837ecedb0b2d0abebb9da7df6b64f0c47ffe11f74a457d56","observation_id":"3d2ea893-bfed-4c7c-bdea-84039af51db9","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:a46a23e90ba72718f4cf2bfadada817d0b5a060613df188dd11c6574cfa14f38","observation_id":"7d453311-f192-4ef9-9781-13d8ec68cf52","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:ffcb25e2f6142571ef7bdc9fb5e426d42d46ff7ba561a0a8366fded3615585ff","observation_id":"0c09906e-8bab-425d-844e-db84854ae697","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:3fc12dc9a01355fda54df142de05715b73bc853399f2b8ef8d43cb1a124bdb37","observation_id":"3b59cdd9-19b7-47f6-8081-9d22bad278bc","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:6d07853f4d1776d13f0d0281400cc763af406514bcb3d3428119d17ba8511a1c","observation_id":"1e151427-95a8-43be-89c9-a9d59594437f","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00079","last_updated":"2025-09-03T14:56:29Z","snapshot_observed_at":"2026-08-07T12:08:57.217593Z","submitted_at":"2024-06-24T02:05:32Z","title":"Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00079","snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"cited_paper":"/paper/2407.00079","citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:660993782fd9cee7ff73b8e5e60fc1570674e5f6e832043eabdf64cb61aabfcd","observation_id":"2f6ad3a4-c991-4d54-9e5d-9ccff413a265","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:b741eb5a7fa8f3fc32ae9a5200e526a7eb354ac6e436a6ff618bbfd87e4642d1","observation_id":"3b8a06cf-6af1-4d1e-af6e-8862197fba1c","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":"2003.Iterative methods for sparse linear systems","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:cbf44b84632622e59a91e3a30a6d60f00663ffaa38377d1e38f591500af037ac","observation_id":"9a489717-3b7b-432e-a2aa-846535eea616","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:060901ad5f0ced5a7b740959af43c67589f223d7da402db72f8c7edc45bc6ad8","observation_id":"a7abd195-2299-48a0-8b27-8be80e8719b5","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:cb55f48b3bebf1a2032935bd455e9cd2dc8bc97e640272f4aaf24c2fe7bee47b","observation_id":"c83ceaa4-8714-4451-a2de-b9851f08b948","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:36864ee241c6772a88192159c5ab886674cecff55b929a3ef02aaa10026a6474","observation_id":"f4943a2c-731b-4ffb-8164-9f435bdef137","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:2fc8ad94544b559e0a3717a7a4e9b989780c04b8bf2099c8a4001b26f22545a7","observation_id":"0713b070-d974-4911-947a-046cb589503b","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:7b3c859a2d594866e37066955b67eb9cdd0a1be637c128b33353fa47f4894fbd","observation_id":"8e0b6b09-347b-40c1-a311-5ddc4e06f5ca","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:b79b8c36f924b0aaa4fb4f618cb277fcfe79b7050f1554449e67c3e2a6f444ab","observation_id":"bb77f60e-7d70-4d34-b372-28e313bede74","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:7ffc5525a1702f6e92aa3368caba8f3c0ba8aec9104a2cef2cd4e7f7bfea09e8","observation_id":"dca45bac-1ef7-4c2c-9d69-2917dad3d82a","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:04475c816f46eb5dbd829980ed15411c5c3f1d5492162e332558003974159ae6","observation_id":"aa2b316e-cab6-4296-b549-125f4995cbfa","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:3c4178e2b711c6084561cc76bc712296a9f9e3860fcd12c982d55604fca91fdd","observation_id":"05c1cd9e-56e3-4be0-a3e7-2cc85682a38d","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T07:32:31.866525Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T07:32:31.866525Z"},"links":{"citing_paper":"/paper/2607.08786"},"observation_digest":"sha256:f080d32480b5b783eb0ebb281704dc557f6e881028806db7a9d6b366f41517ae","observation_id":"c592ae79-9896-4d9c-aa21-6489a6679045","resolution":{"observed_at":"2026-07-13T07:32:31.866525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.08786","last_updated":"2026-06-13T13:38:27Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T03:59:42.021576Z","submitted_at":"2026-06-13T13:38:27Z","title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2607.08786."}