{"as_of":"2026-08-15T14:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:654a5c6c2cfb9c6b87b78619c97efc7c01b3a41ca0183fae8cbc8ae5a1a7b898","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T19:10:12.377428Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T09:15:32.395442Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T09:16:19.701023Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"cited_work":{"arxiv_id":"2412.07174","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.07174","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2412.07174 , year=","venue":null,"work_id":"3735bf2b-4f53-4474-bbe6-7757cdf72794","year":null},"citing_paper":{"arxiv_id":"2509.22166","last_updated":"2026-04-24T11:44:43Z","snapshot_observed_at":"2026-07-06T22:30:50.642382Z","submitted_at":"2025-09-26T10:27:55Z","title":"Motivating Next-Gen Accelerators with Flexible (N:M) Activation Sparsity via Benchmarking Lightweight Post-Training Sparsification Approaches","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T13:36:55.938673Z"},"links":{"cited_paper":"/paper/2412.07174","citing_paper":"/paper/2509.22166"},"observation_digest":"sha256:abbdb6deb127490cb62e68bfe81bc6c1ed22d39e221779892110471330abd8d0","observation_id":"dda4dc23-5b3d-4cf9-9abb-97e25ee1380e","resolution":{"observed_at":"2026-05-18T13:41:25.932269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"cited_work":{"arxiv_id":"2412.07174","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.07174","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2412.07174 , year=","venue":null,"work_id":"3735bf2b-4f53-4474-bbe6-7757cdf72794","year":null},"citing_paper":{"arxiv_id":"2605.17659","last_updated":"2026-05-20T20:56:41Z","snapshot_observed_at":"2026-08-14T02:50:30.487943Z","submitted_at":"2026-05-17T21:29:20Z","title":"Bug or Feature$^2$: Weight Drift, Activation Sparsity and Spikes","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-20T13:46:32.405079Z"},"links":{"cited_paper":"/paper/2412.07174","citing_paper":"/paper/2605.17659"},"observation_digest":"sha256:cdf810b7cb35170d035725ef7a786bb0fd65508eabbac0d7167b4ce5fefd993f","observation_id":"c84d0f38-33e9-44c4-bf7c-65b2fdb329d6","resolution":{"observed_at":"2026-05-20T13:48:19.653782Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"cited_work":{"arxiv_id":"2412.07174","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.07174","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2412.07174 , year=","venue":null,"work_id":"3735bf2b-4f53-4474-bbe6-7757cdf72794","year":null},"citing_paper":{"arxiv_id":"2605.17659","last_updated":"2026-05-20T20:56:41Z","snapshot_observed_at":"2026-08-14T02:50:30.487943Z","submitted_at":"2026-05-17T21:29:20Z","title":"Bug or Feature$^2$: Weight Drift, Activation Sparsity and Spikes","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-22T09:15:32.395442Z"},"links":{"cited_paper":"/paper/2412.07174","citing_paper":"/paper/2605.17659"},"observation_digest":"sha256:233d60ab65a2133b7a6a26cea2ce2a0dc88f81327499fdebc7ae7eaf15f8a845","observation_id":"d5c2466b-e4b1-45a9-b5a6-169903a8ddc4","resolution":{"observed_at":"2026-05-22T09:16:19.703261Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.07174/citation-record","integrity":"/paper/2412.07174/integrity","json":"/paper/2412.07174/citation-record.json","paper":"/paper/2412.07174"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.16635","last_updated":"2024-10-17T15:45:10Z","snapshot_observed_at":"2026-08-12T23:36:06.820078Z","submitted_at":"2024-06-24T13:41:08Z","title":"ShadowLLM: Predictor-based Contextual Sparsity for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16635","snapshot_observed_at":"2026-08-11T19:10:12.260196Z","title":"AbouElhamayed, Jordan Dotzel, Zhiru Zhang, Alexander M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T19:10:12.260196Z"},"links":{"cited_paper":"/paper/2406.16635","citing_paper":"/paper/2412.07174"},"observation_digest":"sha256:64ba4cec98df5d5a70f5dde5835367f6f00eec6fd5e37894ad22201384d1fd40","observation_id":"280d328a-dc58-4e13-a3b5-aa1a30dc5311","resolution":{"observed_at":"2026-08-11T19:10:12.260196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11514","last_updated":"2024-07-30T23:37:20Z","snapshot_observed_at":"2026-08-13T15:23:42.211600Z","submitted_at":"2023-12-12T18:57:08Z","title":"LLM in a flash: Efficient Large Language Model Inference with Limited Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11514","snapshot_observed_at":"2026-08-11T19:10:12.264153Z","title":"Del Mundo, Mohammad Rastegari, and Mehrdad Farajtabar","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T19:10:12.264153Z"},"links":{"cited_paper":"/paper/2312.11514","citing_paper":"/paper/2412.07174"},"observation_digest":"sha256:db40e49ee1cbb2a9a0261dffda6b8e916cc457580fb5e70bf56dad1935b1cf14","observation_id":"b14fe271-994e-4c4a-ae18-d8aff161c048","resolution":{"observed_at":"2026-08-11T19:10:12.264153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16867","last_updated":"2023-11-29T19:45:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-28T15:12:47Z","title":"The Falcon Series of Open Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16867","snapshot_observed_at":"2026-08-11T19:10:12.268008Z","title":"The Falcon Series of Open Language Models, November 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T19:10:12.268008Z"},"links":{"cited_paper":"/paper/2311.16867","citing_paper":"/paper/2412.07174"},"observation_digest":"sha256:f75769d7534799f15f50503cc3cbb59050d44755e468372c41a7ef0c1f41d911","observation_id":"8bfddecf-95b6-401d-b927-d0ba398bb673","resolution":{"observed_at":"2026-08-11T19:10:12.268008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:10:12.271746Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T19:10:12.271746Z"},"links":{"citing_paper":"/paper/2412.07174"},"observation_digest":"sha256:3ec3ba4c023f37de90fa107c06bf178cf6f28f7667cbc1ee6f4d791b207e4805","observation_id":"741fa0cf-3356-4663-bde0-974a038ae995","resolution":{"observed_at":"2026-08-11T19:10:12.271746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-11T19:10:12.275572Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T19:10:12.275572Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2412.07174"},"observation_digest":"sha256:5d94313a617b6e7253fb9a859362623f3557b756994b1ae5983d89ccceb1cbc4","observation_id":"a9bb9ded-0e67-41fb-b47a-b8d38ff12b29","resolution":{"observed_at":"2026-08-11T19:10:12.275572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:10:12.279811Z","title":"Imagenet: A large- scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T19:10:12.279811Z"},"links":{"citing_paper":"/paper/2412.07174"},"observation_digest":"sha256:5d4282381ba48cf5ebd794e28626c90f71dcf4bfb48516d80b6c1d5121fb41e9","observation_id":"81964990-eb6e-43de-9558-bb0a383b7bed","resolution":{"observed_at":"2026-08-11T19:10:12.279811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:10:12.284338Z","title":"Lighteval: A lightweight framework for llm evaluation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T19:10:12.284338Z"},"links":{"citing_paper":"/paper/2412.07174"},"observation_digest":"sha256:07cc2e1487ad504d81ade7b9923e28310b67383757e8cf5f8ea8178d9fb4f9c5","observation_id":"8dda6c5f-b1af-48bb-83d1-fe773bd21e12","resolution":{"observed_at":"2026-08-11T19:10:12.284338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-11T21:19:33.078277Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-11T19:10:12.287699Z","title":"GPTQ: Accurate Post- Training Quantization for Generative Pre-trained Transformers, March 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T19:10:12.287699Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2412.07174"},"observation_digest":"sha256:0506c2b6f0ae638185dc5eac54dae5b78ac32ce2d5121de68dadd4cca68b8299","observation_id":"4551c7b6-0d29-4b4a-98da-3cb1700cdaac","resolution":{"observed_at":"2026-08-11T19:10:12.287699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:10:12.291129Z","title":"A framework for few-shot language model evaluation, 12 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T19:10:12.291129Z"},"links":{"citing_paper":"/paper/2412.07174"},"observation_digest":"sha256:19942bced85a703937ffe4427be2d5b6f775262572e897d3b8e41c76d55ba85b","observation_id":"1c7da6ca-bfa4-457a-a5c5-3d027ec7d514","resolution":{"observed_at":"2026-08-11T19:10:12.291129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:10:12.727051Z","title":"Learning both Weights and Connections for Efficient Neural Network","venue":null,"work_id":"e4bc2d53-40e8-40c7-acac-26fbd8be7e2e","year":2015},"citing_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T19:10:12.295101Z"},"links":{"citing_paper":"/paper/2412.07174"},"observation_digest":"sha256:304bde08f3c5f4c9c3d57ec33bae1e423e540e75493359f6fcf4e6ea3d352a8a","observation_id":"6067ffdc-672b-4dc0-99fb-f755b92b40e1","resolution":{"observed_at":"2026-08-11T19:10:12.730667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:10:12.298674Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T19:10:12.298674Z"},"links":{"citing_paper":"/paper/2412.07174"},"observation_digest":"sha256:38c74186f0fb11f496f8ecc86a28e3f6e8cd30406e5b7c36be13fd8497ceedbd","observation_id":"589ea3f2-8c77-4d3e-821d-8c556ed22efa","resolution":{"observed_at":"2026-08-11T19:10:12.298674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08763","last_updated":"2024-11-03T10:25:47Z","snapshot_observed_at":"2026-08-13T00:31:04.489992Z","submitted_at":"2024-04-12T18:42:18Z","title":"CATS: Contextually-Aware Thresholding for Sparsity in Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08763","snapshot_observed_at":"2026-08-11T19:10:12.302032Z","title":"CATS: Contextually-Aware Thresholding for Sparsity in Large Language Models, April 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T19:10:12.302032Z"},"links":{"cited_paper":"/paper/2404.08763","citing_paper":"/paper/2412.07174"},"observation_digest":"sha256:d068bd15a71a690c016772c04f4200a624e9c2de9a8e4b34f5445ee7ce03b361","observation_id":"1b86ad54-ae76-4bc1-b3cf-e6a01e55f0b4","resolution":{"observed_at":"2026-08-11T19:10:12.302032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:10:12.710277Z","title":"The Lazy Neuron Phenomenon: On Emergence Of Activation Sparsity In Transformers","venue":null,"work_id":"7c6008a0-90a2-4f48-acee-eb9db5c6200f","year":2023},"citing_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T19:10:12.306060Z"},"links":{"citing_paper":"/paper/2412.07174"},"observation_digest":"sha256:53ea852c50107621e1fc883630dcb6b808ad2faa61f6939cee24ddd79ce99157","observation_id":"d80816d0-855f-4164-ba16-0401249383fc","resolution":{"observed_at":"2026-08-11T19:10:12.714141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00978","last_updated":"2026-04-25T06:58:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T17:59:10Z","title":"AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00978","snapshot_observed_at":"2026-08-11T19:10:12.309454Z","title":"AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration, July 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T19:10:12.309454Z"},"links":{"cited_paper":"/paper/2306.00978","citing_paper":"/paper/2412.07174"},"observation_digest":"sha256:691bc3c642d3f62d5fb6d087c9832590a197fc49a29e6e5a6057cbaac29d6288","observation_id":"e40f70d6-d7ae-4fa9-b141-9647ef6e383d","resolution":{"observed_at":"2026-08-11T19:10:12.309454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:10:12.697812Z","title":"Deja Vu: contextual sparsity for efficient LLMs at inference time","venue":null,"work_id":"b684ffb9-219f-4d0c-90bb-fede0b6c0429","year":null},"citing_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T19:10:12.313040Z"},"links":{"citing_paper":"/paper/2412.07174"},"observation_digest":"sha256:a7955f010405673dae74db83caf898a0c7261ab980fe15e06ae558a2c0269521","observation_id":"9a78cbcf-03e9-4a46-978a-5ae2c09a7981","resolution":{"observed_at":"2026-08-11T19:10:12.701532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:10:12.317143Z","title":"Pointer sentinel mixture models, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T19:10:12.317143Z"},"links":{"citing_paper":"/paper/2412.07174"},"observation_digest":"sha256:25a2d1314b02176163f05e3ed182c9ae25a0a14e2f0833e6457cd49ebe14d3dd","observation_id":"85e6ce89-48de-4cf2-aacd-118596a22083","resolution":{"observed_at":"2026-08-11T19:10:12.317143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:10:12.677922Z","title":"del Mundo, Oncel Tuzel, Golnoosh Samei, Mohammad Rastegari, and Mehrdad Farajtabar","venue":null,"work_id":"c5d080a5-2111-43ec-94af-b915f321e630","year":2023},"citing_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T19:10:12.321964Z"},"links":{"citing_paper":"/paper/2412.07174"},"observation_digest":"sha256:534ddf9e2740ca61ac8bc7781cf6a92ecc7a66d99d292072908fdd8fefaa2048","observation_id":"825df76c-bb36-4846-b8e9-cc07ad8cc63a","resolution":{"observed_at":"2026-08-11T19:10:12.682179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:10:12.326032Z","title":"Orca-math: Unlocking the potential of slms in grade school math, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T19:10:12.326032Z"},"links":{"citing_paper":"/paper/2412.07174"},"observation_digest":"sha256:0e09c9c6a1d73e702e941e97238063e2193eb0f5010c379bfb40ae239d733246","observation_id":"a94a3930-be6e-499c-bcab-10ddee45852d","resolution":{"observed_at":"2026-08-11T19:10:12.326032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:10:12.329933Z","title":"Openwebmath: An open dataset of high-quality mathematical web text, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T19:10:12.329933Z"},"links":{"citing_paper":"/paper/2412.07174"},"observation_digest":"sha256:17c55e015d957332ec8a0aa521004950f836f4fa533ca08ceb727bb8739f62a3","observation_id":"d8485e8a-0fd2-4802-b0a7-f9ca729e54d2","resolution":{"observed_at":"2026-08-11T19:10:12.329933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:10:12.645659Z","title":"Efficiently Scaling Transformer Inference","venue":null,"work_id":"b4154bfe-c796-4262-ac43-3496cfa54138","year":2023},"citing_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T19:10:12.333102Z"},"links":{"citing_paper":"/paper/2412.07174"},"observation_digest":"sha256:bff8af11d781bff828be30ec07b5d00d73c4a5e15cf41ce0f247a74254af7321","observation_id":"911e61d7-7439-4691-9c25-c6a3b35ca5dd","resolution":{"observed_at":"2026-08-11T19:10:12.650597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:10:12.336891Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T19:10:12.336891Z"},"links":{"citing_paper":"/paper/2412.07174"},"observation_digest":"sha256:99c2ae91c13ccb7ee2e03a1c68363a5569ad7033ab1ea1a6c8d8a876ee829cc5","observation_id":"93d3aefc-7c4d-4009-a316-2c35da09ef00","resolution":{"observed_at":"2026-08-11T19:10:12.336891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:10:12.623414Z","title":"Introducing MPT-7B: A New Standard for Open-Source, Commercially Usable LLMs | Databricks Blog, May 2023","venue":null,"work_id":"95c408b3-a434-4423-81ee-ea479680ccc2","year":2023},"citing_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T19:10:12.340999Z"},"links":{"citing_paper":"/paper/2412.07174"},"observation_digest":"sha256:ad08b4429d3b2d1022c4ff90ec555ede1fe2074222ec3a013a5f36fe298e6d48","observation_id":"d959ad66-c66f-4c14-917e-09f71bf583b9","resolution":{"observed_at":"2026-08-11T19:10:12.627181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-08-11T06:21:56.129166Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-11T19:10:12.344332Z","title":"GLU Variants Improve Transformer, February 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T19:10:12.344332Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2412.07174"},"observation_digest":"sha256:e91ddb2b289459180478654104920f8eb086b67d4a2e08b508ba8ad1355d55f1","observation_id":"977626c5-0a1a-4478-aebc-1c0d1db9c45e","resolution":{"observed_at":"2026-08-11T19:10:12.344332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13516","last_updated":"2025-01-07T05:26:54Z","snapshot_observed_at":"2026-08-13T04:14:02.008085Z","submitted_at":"2024-02-21T03:58:49Z","title":"ProSparse: Introducing and Enhancing Intrinsic Activation Sparsity within Large Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13516","snapshot_observed_at":"2026-08-11T19:10:12.348098Z","title":"ProSparse: Introducing and Enhancing Intrinsic Activation Sparsity within Large Language Models, July 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T19:10:12.348098Z"},"links":{"cited_paper":"/paper/2402.13516","citing_paper":"/paper/2412.07174"},"observation_digest":"sha256:68e498bf11c4c4fc34d7e0ab5d2559cd7d0d2a45523106835f2f2c41eaa0d7be","observation_id":"423c1915-f1b1-41e7-a341-62d0aa957ba9","resolution":{"observed_at":"2026-08-11T19:10:12.348098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12456","last_updated":"2024-12-12T12:38:12Z","snapshot_observed_at":"2026-08-13T05:00:32.918196Z","submitted_at":"2023-12-16T02:27:00Z","title":"PowerInfer: Fast Large Language Model Serving with a Consumer-grade GPU","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12456","snapshot_observed_at":"2026-08-11T19:10:12.351877Z","title":"PowerInfer: Fast Large Language Model Serving with a Consumer-grade GPU, December 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T19:10:12.351877Z"},"links":{"cited_paper":"/paper/2312.12456","citing_paper":"/paper/2412.07174"},"observation_digest":"sha256:aa8bff61139432414a2f28121202dbd0af099af3c91cd7e4bc1ef1189bbbe07d","observation_id":"3f08e0f2-686f-4e68-9801-49991e20567e","resolution":{"observed_at":"2026-08-11T19:10:12.351877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05955","last_updated":"2024-06-11T02:15:47Z","snapshot_observed_at":"2026-08-12T23:46:48.915843Z","submitted_at":"2024-06-10T01:21:59Z","title":"Turbo Sparse: Achieving LLM SOTA Performance with Minimal Activated Parameters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05955","snapshot_observed_at":"2026-08-11T19:10:12.355895Z","title":"Turbo Sparse: Achieving LLM SOTA Performance with Minimal Activated Parameters, June 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T19:10:12.355895Z"},"links":{"cited_paper":"/paper/2406.05955","citing_paper":"/paper/2412.07174"},"observation_digest":"sha256:c08a10a0576d8c81670348df3c2a2a51feb27409e9ff8519f551233bd219ecf4","observation_id":"f5bd577f-38f8-46c3-bacf-4e60031728d6","resolution":{"observed_at":"2026-08-11T19:10:12.355895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-08-13T04:32:33.562415Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-11T19:10:12.359831Z","title":"Zico Kolter","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T19:10:12.359831Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2412.07174"},"observation_digest":"sha256:5473bd465474104bca70104efe1c4518c8b984420889db507c91855827c944e6","observation_id":"1226f33a-7336-4176-a183-958964c1dfab","resolution":{"observed_at":"2026-08-11T19:10:12.359831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:10:12.610360Z","title":"Deit iii: Revenge of the vit","venue":null,"work_id":"ca51289e-1177-427a-8483-e4f27be5873c","year":2022},"citing_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T19:10:12.363182Z"},"links":{"citing_paper":"/paper/2412.07174"},"observation_digest":"sha256:0cabbbcd5f36819360160103748155ae5247e74515e45da92ad9b3dc5e1ef32b","observation_id":"ded954f3-7b1b-497a-a301-0e1f4513897e","resolution":{"observed_at":"2026-08-11T19:10:12.613789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:10:12.367166Z","title":"Gpt-j-6b: A 6 billion parameter autoregressive language model, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T19:10:12.367166Z"},"links":{"citing_paper":"/paper/2412.07174"},"observation_digest":"sha256:3841b65ef4c8abb117837351b299ec2e24385e2b8faf56732e5a4dfefcd11c6d","observation_id":"e01fcfe7-ba03-41a7-a36a-616b253977c0","resolution":{"observed_at":"2026-08-11T19:10:12.367166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:10:12.591929Z","title":null,"venue":null,"work_id":"0fe8f249-c888-4eb1-ac9c-202b77a08e3d","year":2019},"citing_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T19:10:12.370965Z"},"links":{"citing_paper":"/paper/2412.07174"},"observation_digest":"sha256:05a8c925b3f5a90641653836e0cf2b665ee5b187b999fa87b494c435acbe41bb","observation_id":"b6938c64-803d-4286-b241-804edeab7372","resolution":{"observed_at":"2026-08-11T19:10:12.594960Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:10:12.577901Z","title":"Orca: A distributed serving system for Transformer-Based generative models","venue":null,"work_id":"ec49387c-c557-4037-a85f-9700bee6e226","year":2022},"citing_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T19:10:12.374205Z"},"links":{"citing_paper":"/paper/2412.07174"},"observation_digest":"sha256:ff282fdc1875bb1959ce2ef814804caed7d54cb8f280431ab85d0cc6d26430a2","observation_id":"192a652e-c373-431c-94d7-2132955e7f7e","resolution":{"observed_at":"2026-08-11T19:10:12.583618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03804","last_updated":"2024-02-06T08:45:51Z","snapshot_observed_at":"2026-08-13T04:25:22.955470Z","submitted_at":"2024-02-06T08:45:51Z","title":"ReLU$^2$ Wins: Discovering Efficient Activation Functions for Sparse LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03804","snapshot_observed_at":"2026-08-11T19:10:12.377428Z","title":"ReLU2 Wins: Discovering Efficient Activation Functions for Sparse LLMs, February 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T19:10:12.377428Z"},"links":{"cited_paper":"/paper/2402.03804","citing_paper":"/paper/2412.07174"},"observation_digest":"sha256:d3b38b248a09b840f75b1d88de11cc5c6138a30a0e69e56e0dbc10085eb23f9a","observation_id":"1ca77669-3b2e-4445-a7c7-eb92c47a144c","resolution":{"observed_at":"2026-08-11T19:10:12.377428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.07174","last_updated":"2024-12-10T04:15:39Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T22:05:32.406542Z","submitted_at":"2024-12-10T04:15:39Z","title":"Post-Training Statistical Calibration for Higher Activation Sparsity"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 3 inbound Pith citation observations for arXiv:2412.07174."}