{"as_of":"2026-08-18T07:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6ef4314632bc7ff240d143643aeb7e37b5e16494bc18a8a1da03198aedd55e04","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T20:11:14.200548Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09291/citation-record","integrity":"/paper/2608.09291/integrity","json":"/paper/2608.09291/citation-record.json","paper":"/paper/2608.09291"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:13.880373Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:13.880373Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:20acfb276af4fca9d9a1713d0a5383ed1dea673c4ede7ff40d0c4268248dd2ba","observation_id":"e32df82e-0b82-4bde-b96e-a6fc77a698a9","resolution":{"observed_at":"2026-08-11T20:11:13.880373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T20:11:13.893367Z","title":"GPT-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:13.893367Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:c4f6c8d872445e01879ac2295b77ea840665103645a645c8ec7b18c1b5294045","observation_id":"36b613a3-f314-42a5-aeaf-e9b2e1b0b291","resolution":{"observed_at":"2026-08-11T20:11:13.893367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:16.311037Z","title":"Edgellm: Fast on-device llm inference with speculative decoding,","venue":null,"work_id":"f9fe22d3-23f3-49e7-b544-c9a403ab1a2d","year":2025},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:13.898827Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:3cee6aa7a5d8447a7cbf63a0dbb36d6f0e8352fab78b186ab1b01345965f43d1","observation_id":"a455d192-1b8b-4c51-a974-5444b2ff48f5","resolution":{"observed_at":"2026-08-11T20:11:16.322895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:13.904026Z","title":"Tenet: An efficient sparsity-aware lut-centric architec- ture for ternary llm inference on edge,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:13.904026Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:a9c9583b3f9079be649c39ee0826398da8d3be3f8f7c32f3e7a54446f7c61b5c","observation_id":"0a85edc2-af46-4ffc-8b5d-7f707be0105f","resolution":{"observed_at":"2026-08-11T20:11:13.904026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:16.269784Z","title":"Efficient inference for edge large language models,","venue":null,"work_id":"7ba65032-8e2e-4cdb-a4d4-6a416fb61727","year":2026},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:13.909424Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:ac533b831de1e53c013160e8481d488c3db2bfc607967ebdd5dc8993b33de972","observation_id":"1fddd498-6867-41f5-8f01-7f2b81bebb31","resolution":{"observed_at":"2026-08-11T20:11:16.282071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.06069","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:15.261948Z","title":"Hqp: Sensitivity-aware hybrid quantization and pruning for ultra-low-latency edge ai inference,","venue":null,"work_id":"50a40695-8d99-4eec-b2ae-9b58f60f9755","year":2026},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:13.917125Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:0bd26c0cf9ec7a6c2243fecffae4929a45cc7d5ff2df9d0e9c7c5d944fa9ab17","observation_id":"3573c1ed-d213-43fe-a8a0-7e6dd3caa118","resolution":{"observed_at":"2026-08-11T20:11:15.277640Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03360","last_updated":"2025-04-04T11:29:30Z","snapshot_observed_at":"2026-08-16T12:43:59.298336Z","submitted_at":"2025-04-04T11:29:30Z","title":"Sustainable LLM Inference for Edge AI: Evaluating Quantized LLMs for Energy Efficiency, Output Accuracy, and Inference Latency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03360","snapshot_observed_at":"2026-08-11T20:11:13.922408Z","title":"Sustainable llm inference for edge ai,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:13.922408Z"},"links":{"cited_paper":"/paper/2504.03360","citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:001f55540f7ae36d816efd6a7afcfdb85bb7b5411827dcb7b0121c3099430101","observation_id":"7256c3b9-6579-4967-b4c3-72bcde7efa2e","resolution":{"observed_at":"2026-08-11T20:11:13.922408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:16.243650Z","title":"A unified and resource-aware framework for adaptive inference optimization on edge devices,","venue":null,"work_id":"831dc74c-fbf4-4ea2-b6b7-59ff79409e1e","year":2025},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:13.928976Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:300876d145d6d3142aa98bb8fe4521acc2ca78183107720661cd5c409964709c","observation_id":"b6dab895-3ee1-4ebe-bd9e-cebfc9fc7376","resolution":{"observed_at":"2026-08-11T20:11:16.250404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.06443","last_updated":"2026-04-14T07:55:36Z","snapshot_observed_at":"2026-08-17T02:54:35.429818Z","submitted_at":"2025-12-06T14:14:01Z","title":"Vec-LUT: Vector Table Lookup for Parallel Ultra-Low-Bit LLM Inference on Edge Devices","version":2},"cited_work":{"arxiv_id":"2512.06443","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.06443","snapshot_observed_at":"2026-08-11T20:11:15.095260Z","title":"Vec-LUT: Vector Table Lookup for Parallel Ultra-Low-Bit LLM Inference on Edge Devices","venue":"cs.DC","work_id":"1912e93c-7964-4361-be0d-2fd7c4625e13","year":2025},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:13.934956Z"},"links":{"cited_paper":"/paper/2512.06443","citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:9eb12b8dae8325321c7e4bc3929e06b45b7e8b16d951ee163f3ec588bb0d35ed","observation_id":"57d5f87a-7660-4883-bf2d-aff7ae0f1811","resolution":{"observed_at":"2026-08-11T20:11:15.103327Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.16653","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:15.042307Z","title":"H2eal: Hybrid-bonding architecture with hybrid sparse attention for efficient long-context llm inference,","venue":null,"work_id":"db415433-c4f8-4097-ab36-1ce7f0df7c02","year":2025},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:13.939638Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:91ae3929c40e227bc697d75d6c41a3debccf883be0e59b1ef73f3744504a74e0","observation_id":"48e8ba41-e9f3-4d7f-ad30-6138c2f9806e","resolution":{"observed_at":"2026-08-11T20:11:15.063507Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:16.210331Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers,","venue":null,"work_id":"0b63e502-31ce-4b32-9eab-6b55e704310e","year":2023},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:13.945458Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:5433e3187be3f4a286d812054237483b8b9650f183cf51c3ff92f0dc4ad620ed","observation_id":"d735169a-fb09-4d58-b1c0-f61e8b9e3d60","resolution":{"observed_at":"2026-08-11T20:11:16.218896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:16.179117Z","title":"Awq: Activation-aware weight quanti- zation for on-device LLM compression and acceleration,","venue":null,"work_id":"b7389065-4c8f-4690-899e-ea3e416fe173","year":2024},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:13.950811Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:9969c4546c6e34a0038dcaa2c6a141fae9c8bc0acda9f5a4ef0c5a9a8a57a685","observation_id":"778cd9c9-cea3-4f58-906c-e3619c3399f9","resolution":{"observed_at":"2026-08-11T20:11:16.188325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:13.955411Z","title":"Qserve: W4a8kv4 quantization and system co-design for efficient llm serving,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:13.955411Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:0ea62fa3c9d41b59983af4406b9863c927000ef9aec08c93d563fdaab63392be","observation_id":"53f80e26-2ee7-465b-b94e-33f9963f40e2","resolution":{"observed_at":"2026-08-11T20:11:13.955411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09426","last_updated":"2025-08-10T14:08:54Z","snapshot_observed_at":"2026-08-16T13:10:06.311790Z","submitted_at":"2024-10-12T08:10:28Z","title":"FlatQuant: Flatness Matters for LLM Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09426","snapshot_observed_at":"2026-08-11T20:11:13.960472Z","title":"Flatquant: Flatness matters for llm quantization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:13.960472Z"},"links":{"cited_paper":"/paper/2410.09426","citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:82c54b2df85f8a6334fb4ca616680fa9b10d3001f4dfd00e3085f21d469467c0","observation_id":"d368b82d-868b-453d-8ba0-de167cbda201","resolution":{"observed_at":"2026-08-11T20:11:13.960472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.07339","last_updated":"2022-11-10T18:14:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-15T17:08:50Z","title":"LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.07339","snapshot_observed_at":"2026-08-11T20:11:13.966910Z","title":"LLM.int8(): 8-bit matrix multiplication for transformers at scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:13.966910Z"},"links":{"cited_paper":"/paper/2208.07339","citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:42712984ef2bb09b72da05bd4dc432c50ef2db61ffdbb971ad577682bad0c0f3","observation_id":"f1c7cdd9-0473-491b-aedb-ad8728347b6c","resolution":{"observed_at":"2026-08-11T20:11:13.966910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:16.137308Z","title":"SmoothQuant: Accurate and efficient post-training quantization for large language models,","venue":null,"work_id":"6518faa9-6046-4d5b-820f-6e785324a8ab","year":2023},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:13.973125Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:497c50296d5bfb2f882c02cba09724f8901c353a5d49e696564f7d117b092893","observation_id":"6cdfe297-8f34-48e2-950f-3814763d6db7","resolution":{"observed_at":"2026-08-11T20:11:16.144878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:16.115378Z","title":"Sparsegpt: Massive language models can be accurately pruned in one-shot,","venue":null,"work_id":"0ec28712-05a6-4a6b-8e56-7380a67e7fc7","year":2023},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:13.978271Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:89e9681383d44e975baccaab17f47857fbf488eeea51ff134b2e1a8833934bfa","observation_id":"046f9a38-d0fb-48d5-ae75-62d1045143ce","resolution":{"observed_at":"2026-08-11T20:11:16.122255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:16.089258Z","title":"Unleashing network/accelerator co-exploration potential on fpgas: A deeper joint search,","venue":null,"work_id":"c27cbe44-f5d1-427b-8334-ba5503bbf27d","year":2024},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:13.982786Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:0944f02238a2947b31b4fc85957e8c3121b2e62dd27a654a8b16d9416702fdb4","observation_id":"bb98d5e5-50cf-4d10-a4c9-069f951d2b3c","resolution":{"observed_at":"2026-08-11T20:11:16.098421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-14T18:47:26.721223Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-11T20:11:13.988363Z","title":"Palm-e: An embodied multimodal language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:13.988363Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:d7e6ade7cc02f7c4fc3e0b951da913849be57906bbc73e20ea992322e7ffe40e","observation_id":"cf7b5df2-95e6-4630-af16-49bcb67304b7","resolution":{"observed_at":"2026-08-11T20:11:13.988363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:13.993348Z","title":"Foundation models in autonomous driving: A survey on scenario generation and scenario analysis,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:13.993348Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:a5b07e2708f887d08d55661e3f9a1c82b18e9a4584c1cb75eb2543a9715b992b","observation_id":"8bb0eb05-3851-4281-a247-d7730da7223b","resolution":{"observed_at":"2026-08-11T20:11:13.993348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03905","last_updated":"2023-08-07T20:43:42Z","snapshot_observed_at":"2026-08-16T15:10:08.686126Z","submitted_at":"2023-08-07T20:43:42Z","title":"Intelligent Assistant Language Understanding On Device","version":1},"cited_work":{"arxiv_id":"2308.03905","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.03905","snapshot_observed_at":"2026-08-11T20:11:14.809394Z","title":"Intelligent Assistant Language Understanding On Device","venue":"cs.CL","work_id":"470d6c1f-7e8d-44b8-9dc7-0e441dd19ae5","year":2023},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:13.998090Z"},"links":{"cited_paper":"/paper/2308.03905","citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:57e250c9477fc4eb60dad9981bf3a1f90ae6a831e11ff8d9b807938fad021d56","observation_id":"44a86edf-1e17-4d32-9cb3-94e35d5ba7b7","resolution":{"observed_at":"2026-08-11T20:11:14.819211Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:14.004286Z","title":"Private llm inference on consumer black- well gpus: A practical guide for cost-effective local deployment in smes,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:14.004286Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:5d5a3f2a46c5785a24127588fc4d356e5d5dc7299de6b633a7780f69b5e6bcc4","observation_id":"4f410ef4-782c-4eb8-9ae9-3e3918c0dd92","resolution":{"observed_at":"2026-08-11T20:11:14.004286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:14.009653Z","title":"Efficient memory management for large language model serving with pagedattention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:14.009653Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:049aade6ab71f94e4353fc9f0bc04f6f32c10c279519dcd7f9ef50e930347645","observation_id":"5df39e1f-77ec-492d-913f-d281794a4cc8","resolution":{"observed_at":"2026-08-11T20:11:14.009653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:16.028487Z","title":"Sparsity in deep learning: Pruning and growth for efficient inference and training in neural networks,","venue":null,"work_id":"aa84b526-053a-4560-ae1b-89922a1c76bc","year":2021},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:14.014423Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:31c11b66037e4bde40f1b48289ba54fffa1fea83e5ffee706e44ca636d799963","observation_id":"096f2b0e-e92e-48ec-9a70-4aef88b8f3e1","resolution":{"observed_at":"2026-08-11T20:11:16.036825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:15.998720Z","title":"Wrp: Weight recover prune for structured sparsity,","venue":null,"work_id":"2377b35c-03b3-414c-9044-b76b64153c20","year":2024},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:14.019429Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:34190670a0980c9ff700b7f8926a39c5a578e30640510a614c82ff47b1cc56e5","observation_id":"64b24222-b831-4819-b475-270e1a2c6a8a","resolution":{"observed_at":"2026-08-11T20:11:16.008394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:15.972788Z","title":"Structured pruning for large language models using coupled components elimination and minor fine-tuning,","venue":null,"work_id":"53f60af9-77dd-4610-941b-4a4c3fc62839","year":2024},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:14.025339Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:92c99b1e61e14941ebdb1236e973d60d08657c51fb01f4515982c9713cc5af87","observation_id":"73ef787b-cd4f-4dcb-a3d3-5df2d51b054a","resolution":{"observed_at":"2026-08-11T20:11:15.978334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:15.951596Z","title":"Unisparta: A unified sparse tensor program tuning framework,","venue":null,"work_id":"87d068a0-4e1a-4a29-9d8c-18edf56fb7dd","year":2025},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:14.031314Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:e9a9c070c4bfceb93fa274fa96f1eeadb8264aeb745fe030d4f68609a0fdc39c","observation_id":"c213d2d9-454f-4641-86e3-b607f2ef8cec","resolution":{"observed_at":"2026-08-11T20:11:15.957569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:15.927274Z","title":"Closertome: A unified framework for accurate and transferable latency prediction across heterogeneous devices,","venue":null,"work_id":"a20a99c3-6870-4c87-8f33-eb9e617d295b","year":2026},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:14.037833Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:26f83fa5d22f3f186c60c69c7ce76e4620f2d307863d2d7866ffc241bff57e50","observation_id":"9f400c61-4807-41f8-8509-6baea235b01b","resolution":{"observed_at":"2026-08-11T20:11:15.934916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:14.042758Z","title":"Sparse gpu kernels for deep learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:14.042758Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:8faf881f1656171c93c4a863f8de0a9333d4c08bcd587b5b6781b938a4a67545","observation_id":"87a07782-4901-43b4-b6c3-1f6bdbf0b776","resolution":{"observed_at":"2026-08-11T20:11:14.042758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:15.893664Z","title":"Dtc-spmm: Bridging the gap in accelerating general sparse matrix multiplication with tensor cores,","venue":null,"work_id":"b025d73a-3e27-4b11-972f-1d89f23ba667","year":2024},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:14.049399Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:354d4777bde963d82cc7edb24ba369098b4c8d79489246c0274a3431730848ef","observation_id":"476a3036-6e4d-4ff3-8694-2888c44c5441","resolution":{"observed_at":"2026-08-11T20:11:15.899565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11551","last_updated":"2024-08-21T11:57:42Z","snapshot_observed_at":"2026-08-16T15:28:40.385008Z","submitted_at":"2024-08-21T11:57:42Z","title":"High Performance Unstructured SpMM Computation Using Tensor Cores","version":1},"cited_work":{"arxiv_id":"2408.11551","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.11551","snapshot_observed_at":"2026-08-11T20:11:14.377576Z","title":"High Performance Unstructured SpMM Computation Using Tensor Cores","venue":"cs.DC","work_id":"1ce55c92-aafd-44f1-bfd9-d0b687b716a9","year":2024},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:14.057480Z"},"links":{"cited_paper":"/paper/2408.11551","citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:6d8399837cae5e839dfc02dd5123e6df787e1eabe11c78a7e6f3d17d0da980e4","observation_id":"9dc8fdac-502c-4518-a87a-36225c41839f","resolution":{"observed_at":"2026-08-11T20:11:14.386302Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:15.873710Z","title":"Acc-spmm: Accelerating general-purpose sparse matrix-matrix multiplication with gpu tensor cores,","venue":null,"work_id":"faba66d7-e269-4b4d-9152-d8945efd5cab","year":2025},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:14.063332Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:d596a94224432b591e158e4cf8c46627bc12d87248c6f74af8e5fdca64b45c5c","observation_id":"d625940a-3aa5-4f92-93e4-2177901cead1","resolution":{"observed_at":"2026-08-11T20:11:15.879741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:15.840937Z","title":"V oltrix: Sparse {Matrix-Matrix}multiplication on tensor cores with asynchronous and balanced kernel optimization,","venue":null,"work_id":"4c78b73f-8cf7-484a-ad3f-8eaff285d0c6","year":2025},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:14.069653Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:3f997e38e6d3e763e7c4e735be4434e14bdbc13ddff0a7e1b996e17e265c8f19","observation_id":"9a51e21c-3b40-411b-b54c-891c67399322","resolution":{"observed_at":"2026-08-11T20:11:15.849359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:15.812383Z","title":"{SparTA}:{Deep-Learning}model sparsity via{Tensor- with-Sparsity-Attribute},","venue":null,"work_id":"6b805cb0-3f03-4ee0-9671-9981c4dcad67","year":2022},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:14.075875Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:dc3eb84a6da4a0475c85f5f84d9ebf564d17fb4de31c6449cd10cd036d455ad7","observation_id":"ca3a53d4-3eb1-4f08-b9c0-1b8529d384b0","resolution":{"observed_at":"2026-08-11T20:11:15.819336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:15.788509Z","title":"cusparse library user guide,","venue":null,"work_id":"67921a6c-dd60-4896-8efe-c7b6356dc431","year":2024},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:14.081652Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:6856cbb9c273c2129fca9038b386ee8505398e022ca126e92dd9b3e122d2f108","observation_id":"e644f87f-7eff-4d7d-83f3-95f372ccef9c","resolution":{"observed_at":"2026-08-11T20:11:15.796539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:15.762047Z","title":"cuSPARSELt,","venue":null,"work_id":"2b47f541-b3eb-46f4-89f7-6cb5e94d85fc","year":2024},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:14.086991Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:37acae0655c3c0dc4d74c61cb2351994d322698a07560e8f1d1db92e30d72b6e","observation_id":"685a4805-e82b-42ba-8f36-c622fb9910e5","resolution":{"observed_at":"2026-08-11T20:11:15.768465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10285","last_updated":"2023-09-19T03:20:02Z","snapshot_observed_at":"2026-08-18T05:11:23.560462Z","submitted_at":"2023-09-19T03:20:02Z","title":"Flash-LLM: Enabling Cost-Effective and Highly-Efficient Large Generative Model Inference with Unstructured Sparsity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10285","snapshot_observed_at":"2026-08-11T20:11:14.093933Z","title":"Flash-llm: Enabling cost-effective and highly-efficient large generative model inference with unstructured sparsity,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:14.093933Z"},"links":{"cited_paper":"/paper/2309.10285","citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:82e6b640be06b54759a6e8c539981e08eb50047815cae63df3d2e839864b32b2","observation_id":"adbbfad2-d07e-4028-99f4-d68fe5a3c4eb","resolution":{"observed_at":"2026-08-11T20:11:14.093933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:15.732798Z","title":"Spinfer: Leveraging low-level sparsity for efficient large language model inference on gpus,","venue":null,"work_id":"6f565690-d504-4c47-a8df-66ba3d617bb4","year":2025},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:14.101175Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:199777d85dc0f4d4ba9f834066fc4ed3ae066561e15dc81fba9b498cd3fd7328","observation_id":"040defa0-ce08-4624-9015-0898cbafeab1","resolution":{"observed_at":"2026-08-11T20:11:15.739592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:15.708687Z","title":"Sputnik: Sparse matrix multiplication on gpus,","venue":null,"work_id":"ea1de863-a873-406d-bb76-b73d5534f343","year":2024},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:14.110607Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:331bb3f9c35176a2bb567ffeaded8f79b75e02cc2d56ff7047f5f4d7607d29a3","observation_id":"b9119f88-8de1-4c92-bbe8-22b3a84e8f60","resolution":{"observed_at":"2026-08-11T20:11:15.714739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:15.677965Z","title":"Nvidia jetson agx orin developer kit,","venue":null,"work_id":"5607a327-fd6f-4a37-b040-289c4a5c6072","year":2024},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:14.116153Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:c2a0161322ea58f0fa1c717ae2128b5e5d8acd6c5d4fa7f4d92249f5f7f3960f","observation_id":"8fcc6f41-34f2-4be4-9336-81e88b79fe16","resolution":{"observed_at":"2026-08-11T20:11:15.684324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T20:11:14.123256Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:14.123256Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:2be0175caa5fa7b461d7711a52506a69861516301176baab992f37a6c521c064","observation_id":"8156f3f9-4bd9-431b-86ac-7285f34dd375","resolution":{"observed_at":"2026-08-11T20:11:14.123256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-11T20:11:14.129460Z","title":"Opt: Open pre-trained transformer language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:14.129460Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:96e08a1795ac53caaed7759a7d58e4a718f710ff3b6a04c5be65bf087e844833","observation_id":"86034bed-f3e5-4c73-8d50-8c8053f20aab","resolution":{"observed_at":"2026-08-11T20:11:14.129460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-11T20:11:14.135742Z","title":"Qwen technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:14.135742Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:057c21903c820200b1881aa45f9c1f00601b741c541a4b2c53f4db701b2ba98f","observation_id":"b6761266-fdb3-45b4-9124-e88596bb7f7f","resolution":{"observed_at":"2026-08-11T20:11:14.135742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:15.644970Z","title":"Llama 3: Open foundation and instruction-tuned models,","venue":null,"work_id":"1a4e755a-34cf-4215-8c03-da76063c7e01","year":2024},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:14.141376Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:7390cf314ca5cdf57f5e1a1bfa9226c2cfbdb5228c5619c6f3b23fae3584d81c","observation_id":"a1e28cf9-2e28-41fb-99b9-4fa3ed02c662","resolution":{"observed_at":"2026-08-11T20:11:15.654539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:15.621388Z","title":"Cutlass: Cuda templates for linear algebra subroutines and solvers,","venue":null,"work_id":"397abc5b-004d-4691-b27e-db4b30f60173","year":2024},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:14.148396Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:728846744f0069743274a6e9dc37ebb5c371f9e671ed0bfa9790188e25e638fe","observation_id":"d504adc6-2e79-4e11-bd1f-0cd281c722d6","resolution":{"observed_at":"2026-08-11T20:11:15.629743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:15.595362Z","title":"cublas library user guide,","venue":null,"work_id":"18ce5708-0ac6-4fe6-a70c-4e68fe459368","year":2024},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:14.159695Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:d498fed369d300829d8ef7694afd90606f5708ee74fc5cd1b12159f3c598a994","observation_id":"d85dbe4e-a52c-4760-8aff-b0bb09672f72","resolution":{"observed_at":"2026-08-11T20:11:15.604215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:15.571763Z","title":"Fastertransformer,","venue":null,"work_id":"64eb36a2-a6ac-4b41-b02e-631810f4ad1c","year":2023},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:14.169034Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:92800c91460fcc10905c48e70a6d68aca1b365ce2c993565e74882eb9bb92b74","observation_id":"d43fd8cd-d093-4e7e-819c-db8ce32c10cb","resolution":{"observed_at":"2026-08-11T20:11:15.576894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:15.547674Z","title":"A simple and effective pruning approach for large language models,","venue":null,"work_id":"96f66342-2f4f-4ee5-827d-9406a7049748","year":2024},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:14.177358Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:f4caa9775f33d966c730ee26daff5315b49f44fc79f0dc5f681c87057c558181","observation_id":"ffc38f0b-64fa-4337-8039-4a66f96141f2","resolution":{"observed_at":"2026-08-11T20:11:15.554020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:15.525875Z","title":"Atom: Low-bit quantization for efficient and accurate llm serving,","venue":null,"work_id":"bf493bbf-6fff-44c4-89f8-4740fc177b32","year":2024},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:14.184734Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:cf9fa7119c209387798cdbc555486bef75bca4d997b8d6dc955b76b7e25c038d","observation_id":"2e7f0333-732b-4d8f-8bc7-9e1ba16b237d","resolution":{"observed_at":"2026-08-11T20:11:15.532365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:15.482228Z","title":"He examines various aspects of embedded systems, with a focus on performance, availability, flexibility, and energy efficiency","venue":null,"work_id":"b2c4bb54-d439-4ab9-b0f1-46c8292274db","year":2003},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:14.200548Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:7d962c7ec210e4e4e4280ea6cf9e61ea9dbe887f631d7ec3d57b9fb86782d107","observation_id":"bd7c9003-2240-4437-a743-b7f1649931cb","resolution":{"observed_at":"2026-08-11T20:11:15.488007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:15.504090Z","title":"He is currently pursuing the Eng.D","venue":null,"work_id":"672c4971-6139-4bf4-b45d-b8edb2a88be8","year":2022},"citing_paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:14.192355Z"},"links":{"citing_paper":"/paper/2608.09291"},"observation_digest":"sha256:08a9915707fb8f73ce7f426295ca00f747f6578dd5f350454c77d74284391933","observation_id":"2f1cdba3-8dda-42f6-86bb-783c038b9f1a","resolution":{"observed_at":"2026-08-11T20:11:15.510650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.09291","last_updated":"2026-08-10T08:43:19Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-17T20:45:32.418172Z","submitted_at":"2026-08-10T08:43:19Z","title":"UnionSparse: An Index-Efficient Sparsity Framework for Low-Bit Sparse LLM Inference on Edge"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":5,"verified_fuzzy":30},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2608.09291."}