{"as_of":"2026-08-13T23:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:13b1d82c82a5a4dbcef001729af135142863d21d6b59f78d84e69efe637f6843","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T19:29:57.522816Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.10054/citation-record","integrity":"/paper/2501.10054/integrity","json":"/paper/2501.10054/citation-record.json","paper":"/paper/2501.10054"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.883298Z","title":"org/wiki/Constant_folding","venue":null,"work_id":"e3d47e1a-04cd-4070-8c44-90707fe2292a","year":null},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.147657Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:54d668ab919ec3957bd9bc8ca8257e85a2315c839d26566df5e6d0b105bf588f","observation_id":"47ae6c4c-283a-4f1e-9acf-e30db799f366","resolution":{"observed_at":"2026-08-10T19:29:58.888357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.867752Z","title":"[Online; accessed 2024- 11-01]","venue":null,"work_id":"bf00b8e7-7fac-41b6-b50f-c8fb89efc612","year":2024},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.154692Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:c2ff52f2324d03956f4c9337c756eb830ae02fbd5eadbc04ddbbdf5771ddee17","observation_id":"55d8c0b9-e687-4110-8705-e7aae8c255d7","resolution":{"observed_at":"2026-08-10T19:29:58.872640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.851382Z","title":"[Online; ac- cessed 2025-01-09]","venue":null,"work_id":"67748e3a-8b85-47dd-a03b-1dc7977a2add","year":2025},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.159847Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:6686a4552a7a3f6d02a74a494b7022a7a8fd564ff680729fad46be932d0d1571","observation_id":"56ef685d-66dd-4872-95bb-ee4cf618b79d","resolution":{"observed_at":"2026-08-10T19:29:58.856969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.835479Z","title":"https://gcc.gnu.org/onlinedocs/gcc/ Optimize-Options.html","venue":null,"work_id":"b8b76128-68c0-49db-bf9c-a923ac673bc9","year":2024},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.165422Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:175aa43c0b1ad10e968d40b6caec2e5ece1e938facbb4d1f1f60f1f56198d23f","observation_id":"686e192f-7b29-4b0b-a239-ada71ce30b8a","resolution":{"observed_at":"2026-08-10T19:29:58.840892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.815403Z","title":"https://github.com/python/cpython?tab= readme-ov-file","venue":null,"work_id":"ec229af5-1cd1-4e8d-9a19-4f861edd736c","year":2024},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.171570Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:25ab5fbed2f78cacaab603c924b2ad24c50f3ae08929012c65c3d500170bc162","observation_id":"f4881877-eaa7-4200-bd99-cd7d376b614b","resolution":{"observed_at":"2026-08-10T19:29:58.823182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.798199Z","title":"[Online; accessed 2024-11-24]","venue":null,"work_id":"073c57e2-e381-4f2b-85e8-5c87c83bd42a","year":2024},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.176789Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:f0476d35de3b69d85ac9078a23f335a89772fce885a6bb2d77034c632fc03e58","observation_id":"d15c553d-6a0f-44a9-a9a5-443a57333b4e","resolution":{"observed_at":"2026-08-10T19:29:58.803467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.781401Z","title":"[Online; accessed 2025-01-14]","venue":null,"work_id":"622ea3f6-b00d-4c0f-b39d-e724bd8c30c5","year":2025},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.183553Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:77408b02fca887e6acd7bc9691e384d6cf0a10c6c516b067dab4a9eb4da24f35","observation_id":"258f282e-e002-4763-8c7e-f22858ebea94","resolution":{"observed_at":"2026-08-10T19:29:58.786582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.765645Z","title":"[Online; accessed 2024-12-16]","venue":null,"work_id":"8068e9bc-a084-48f0-b3a4-4bae50d08be7","year":2024},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.189683Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:77f7dda6a4511a65100be7fea8e37e733e0035d18f9115c892ef28cfebb0904f","observation_id":"b697275b-1576-48bc-b4a7-87f5c83864ac","resolution":{"observed_at":"2026-08-10T19:29:58.770903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.749280Z","title":"apache.org/sql/","venue":null,"work_id":"178f4744-d53c-431d-a2b9-1118836df1c1","year":2024},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.198549Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:fdb95b7fb0b36b8c98c505df6b2c5cb11e1e008b18145f16b6dacfc9b7341665","observation_id":"b3ca9336-7a7b-4891-b59e-1e533fe61770","resolution":{"observed_at":"2026-08-10T19:29:58.754438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.733093Z","title":"https://huggingface.co/docs/ transformers/index","venue":null,"work_id":"e7b4364f-1e82-4623-9133-f8f55accc731","year":2024},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.205585Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:ddce63aec7085135f96adf213092579f34c48d0f6137da372f55c23f50f99fcb","observation_id":"f11c88ed-e790-4a31-99d8-9faa3c59d64a","resolution":{"observed_at":"2026-08-10T19:29:58.738207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.712107Z","title":"https://docs.rapids.ai/api/ cuml/stable/","venue":null,"work_id":"f0609854-2035-4f17-a588-f7510da11032","year":2024},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.210748Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:8de86f8163e2db9c41a20cc5e649d7f659090be6c707c7fef97140712be15d87","observation_id":"bbbec6b4-63bf-4896-afab-21dc14a73e46","resolution":{"observed_at":"2026-08-10T19:29:58.718415Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.686868Z","title":"[Online; accessed 2025-01-09]","venue":null,"work_id":"5091f606-e756-470d-b03c-50ed767c1557","year":2023},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.216185Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:b83be22de3b328e6cbfd3b917b6fcb94db14b1e8cf954f2e28ac9604459743c5","observation_id":"010db526-213b-4a13-863c-b8a8ac4d08ba","resolution":{"observed_at":"2026-08-10T19:29:58.697082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.669266Z","title":"[Online; accessed 2024-11-01]","venue":null,"work_id":"1aef6030-35eb-48dc-a570-dfa66f0492b9","year":2023},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.221111Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:904c94462d6bfadbbbb9c929d47d5579bece9b5cbe42b76f6518e2541acfd861","observation_id":"1c70fca2-9dc9-4be8-bea8-015e1d594fab","resolution":{"observed_at":"2026-08-10T19:29:58.675134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.529391Z","title":null,"venue":null,"work_id":"6792ac50-7a97-4392-9db1-dbf8a0f2a661","year":null},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.226076Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:fef69caa7c4abbee65e9d4ad8078c76a94a402cd0edc6e0b9426557689474e00","observation_id":"6cd4a652-4e7e-4b9d-ad5d-9e01c31131e7","resolution":{"observed_at":"2026-08-10T19:29:58.534923Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.484662Z","title":"[Online; ac- cessed 2025-01-13]","venue":null,"work_id":"55097b0d-8d53-4ef1-b44c-6f3b342d00fb","year":2023},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.236415Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:ebd1bf7b6eecdfb7e13aa77092eca0e6387f7ec41f571778612abe1792797682","observation_id":"4b978dbe-baaa-4f16-bbf0-1369b183af35","resolution":{"observed_at":"2026-08-10T19:29:58.490506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.467829Z","title":"[On- line; accessed 2025-01-09]","venue":null,"work_id":"a257c7bc-810c-4b1a-b8f7-a802df4e82f8","year":2024},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.244570Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:fb107c6b7c9f97819820afa802fcd548c2b20f0fe89cd908f696928fd1427a04","observation_id":"bff2270c-2764-47fa-b352-87e0f84d5b2e","resolution":{"observed_at":"2026-08-10T19:29:58.472818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.451533Z","title":"[Online; accessed 2025-01-09]","venue":null,"work_id":"fbc7d318-79bd-4a87-af8b-bd8f4f10b7bc","year":2024},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.249466Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:6e9677a3e23eb66fe631d246722ee3ec24682b3f36ee521a1f1569dedd84587b","observation_id":"88f6008b-4556-4b6c-9501-13585b7a9590","resolution":{"observed_at":"2026-08-10T19:29:58.456927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.433585Z","title":"[Online; accessed 2025-01-08]","venue":null,"work_id":"05ebb27d-7905-493d-b725-0ba74200f859","year":2024},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.254987Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:41a0b2a1a88563b7c51a5ead77e455e9b3f62e4edbfa8155c36795766464950e","observation_id":"f68de9b5-8556-493f-bb2a-c550855ce721","resolution":{"observed_at":"2026-08-10T19:29:58.439339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.409833Z","title":"The falcon series of open language models, 2023","venue":null,"work_id":"f8dd7f1f-08a8-4d1a-b53e-1491a168cad2","year":2023},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.260921Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:c8350c3a772dcbcc75c5e4886693524de7b04324d8059a599e42bac0697adb13","observation_id":"b4b13c58-2e90-40d2-a3d1-7788b69cd37f","resolution":{"observed_at":"2026-08-10T19:29:58.416389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:57.266092Z","title":"Piqa: Reasoning about physical commonsense in natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.266092Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:be98717b4ad2f054bff1898d342dfeb5f7406b3be27ea35bb92b7e92798fa3b8","observation_id":"b27dfc9a-5afb-407a-8e45-e09b9b3961f3","resolution":{"observed_at":"2026-08-10T19:29:57.266092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-10T19:29:57.271270Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.271270Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:9d1b85ae5395ce2cdb60a0238a919df5e065e7b50ee1a996e3540fb74bd0c818","observation_id":"017692bf-2f49-48e6-956a-d395eeab2110","resolution":{"observed_at":"2026-08-10T19:29:57.271270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13211","last_updated":"2023-12-20T17:27:25Z","snapshot_observed_at":"2026-08-13T04:57:28.529248Z","submitted_at":"2023-12-20T17:27:25Z","title":"DSFormer: Effective Compression of Text-Transformers by Dense-Sparse Weight Factorization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13211","snapshot_observed_at":"2026-08-10T19:29:57.276290Z","title":"Dsformer: Effective compression of text-transformers by dense-sparse weight factorization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.276290Z"},"links":{"cited_paper":"/paper/2312.13211","citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:0217736f729d200c888de773d83ec5b66d0cbed50501594095ad8356d0e1565c","observation_id":"4fe328c4-ecac-403e-9e30-8f3396adca7f","resolution":{"observed_at":"2026-08-10T19:29:57.276290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.07289","last_updated":"2016-02-22T07:02:58Z","snapshot_observed_at":"2026-08-12T19:49:02.032824Z","submitted_at":"2015-11-23T15:58:05Z","title":"Fast and Accurate Deep Network Learning by Exponential Linear Units (ELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.07289","snapshot_observed_at":"2026-08-10T19:29:57.281478Z","title":"Fast and accurate deep network learning by exponential linear units (elus)","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.281478Z"},"links":{"cited_paper":"/paper/1511.07289","citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:716f8acb1bddcc6fd35bafe7731309fe9ddb6862413cf528dbb1d3b6eb658fe1","observation_id":"fd6b491b-2a39-4729-8837-64d16d867ec8","resolution":{"observed_at":"2026-08-10T19:29:57.281478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.376835Z","title":"Language modeling with gated convolutional networks","venue":null,"work_id":"b5e3bce8-10de-4209-ac42-c763119e368b","year":2017},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.287744Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:a8b217e6c8ec3ec0b0e6c50506bf9d956104de8b6bed56db00c4b1fcf97c779f","observation_id":"fee8dd64-3654-468a-a685-0ded02614e57","resolution":{"observed_at":"2026-08-10T19:29:58.382599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.358297Z","title":"Llm.int8(): 8-bit matrix multiplication for transformers at scale","venue":null,"work_id":"d930263e-ded3-4952-bb11-4cd21e1d9e47","year":2024},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.293446Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:1f02f6156fa948da1c8fd12d5c0677cacc20ab8d584a22075de0ffbd4a997b53","observation_id":"fdb5e811-bcee-4fb0-9bc1-7163780e91f5","resolution":{"observed_at":"2026-08-10T19:29:58.364075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T19:29:57.298769Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.298769Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:5ec87a16469117328fab7c46c12baa9ad07f635639055e9ee0c5969b9412135b","observation_id":"154393a1-edb9-481e-9196-f3b62b4bdda5","resolution":{"observed_at":"2026-08-10T19:29:57.298769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.339087Z","title":"Sigmoid- weighted linear units for neural network function ap- proximation in reinforcement learning","venue":null,"work_id":"49a3e495-d035-45e4-b52d-8a19ed7edb59","year":2018},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.304574Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:e7c5293a4327eb23bf7da19f5b3b1d435918e369499d3ad77dba093bae796437","observation_id":"dc653491-8c84-4b7e-9393-42bd93d952fa","resolution":{"observed_at":"2026-08-10T19:29:58.346146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.317161Z","title":"Optq: Accurate quantization for generative pre-trained transformers","venue":null,"work_id":"c4255189-e5aa-491c-b7a4-8a86830b4334","year":2022},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.309622Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:83b7e32dd91fe317ddd9b38076764c185d7dbca84468b83b6674cb7787d714d5","observation_id":"5c263d24-44cb-4662-9dfb-f2adc114ba08","resolution":{"observed_at":"2026-08-10T19:29:58.323329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.298850Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers, 2023","venue":null,"work_id":"922cbb01-0bc9-4a46-8a6b-a9a776e334e1","year":2023},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.315347Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:9491e1afe27250f2c42dfbf8dff1957d4f3d2c03d2dbea5365c929166118c8e6","observation_id":"71bedc88-247f-47da-ba68-465f7b400241","resolution":{"observed_at":"2026-08-10T19:29:58.304420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:57.320726Z","title":"A framework for few-shot language model evaluation, 07 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.320726Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:cd9b0a23bd9c2b0a6d031c62c4ee5b4d4d4fb2d53ba4cef3be95bd2c01ead424","observation_id":"397f3daa-a141-4857-8a3c-a925630621b3","resolution":{"observed_at":"2026-08-10T19:29:57.320726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08543","last_updated":"2026-01-31T09:16:35Z","snapshot_observed_at":"2026-08-13T16:04:46.474244Z","submitted_at":"2023-06-14T14:44:03Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08543","snapshot_observed_at":"2026-08-10T19:29:57.326671Z","title":"Knowledge distillation of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.326671Z"},"links":{"cited_paper":"/paper/2306.08543","citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:82150f56f9e73a0a1ce84d7dc91374fbd5ef87090cff72d5f7933170d434ecca","observation_id":"432917f4-daa3-4f17-ab2b-76eaafc1b8e9","resolution":{"observed_at":"2026-08-10T19:29:57.326671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.268562Z","title":"How to access global memory efficiently in cuda c/c++ kernels | nvidia technical blog, 4 2014","venue":null,"work_id":"fe4e1be6-da12-4d37-95e4-0e7ec63baf2f","year":2014},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.332094Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:1583158a8021c96f9713e8938e74074bd9ddb2ee4dada911ddc03e6535ac8ef5","observation_id":"90c98b53-7fd3-4a8e-8af1-59f0c6f11aee","resolution":{"observed_at":"2026-08-10T19:29:58.274639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-08-13T19:48:28.322536Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-10T19:29:57.337129Z","title":"Gaussian error linear units (gelus)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.337129Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:3d1ac99f009451d87d40b9feea29a81812ac94039cc51df44b20b82c74794e98","observation_id":"f750f5dc-3400-42b7-8dcc-2652d26c3692","resolution":{"observed_at":"2026-08-10T19:29:57.337129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09723","last_updated":"2023-08-16T23:57:41Z","snapshot_observed_at":"2026-08-13T10:33:21.000204Z","submitted_at":"2023-08-16T23:57:41Z","title":"FineQuant: Unlocking Efficiency with Fine-Grained Weight-Only Quantization for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09723","snapshot_observed_at":"2026-08-10T19:29:57.342704Z","title":"Finequant: Unlocking effi- ciency with fine-grained weight-only quantization for llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.342704Z"},"links":{"cited_paper":"/paper/2308.09723","citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:fa42cd29716126080a3b794c21c4c7016ad4d798c2fafe327757e9269e45459e","observation_id":"0e47903f-e0b9-494a-8a65-9aed501f3e0a","resolution":{"observed_at":"2026-08-10T19:29:57.342704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.251752Z","title":"Self-normalizing neural networks","venue":null,"work_id":"afc0e9a7-ec6c-4c9f-88c0-1042de882b60","year":2017},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.347896Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:73065148c40fb8cd8f5029d9f64182b86c3c65908078ac30d7d122bca9801720","observation_id":"d7d81d1e-463c-4a16-921d-6908ca8824ed","resolution":{"observed_at":"2026-08-10T19:29:58.257335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.232846Z","title":"Pruning vs quanti- zation: Which is better? Advances in neural information processing systems, 36:62414–62427, 2023","venue":null,"work_id":"27386c82-dff6-4187-9e38-56cd9d74250e","year":2023},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.352719Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:55194f59f82eaa44cd4b2f52a6381b4358ef08ababc067a351b5328298e16891","observation_id":"33d35ab0-8ac1-4c4d-8c6e-3994e1105e14","resolution":{"observed_at":"2026-08-10T19:29:58.239012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.214439Z","title":"Efficient memory man- agement for large language model serving with page- dattention","venue":null,"work_id":"ddbb22de-4b06-4121-b460-22ebe3cc424b","year":2023},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.357571Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:9fd62e8f0325bc0f532d67621d87ae0c9c23ed5164bb464a021032aaf5855c9d","observation_id":"e1665b7b-dcf2-4388-bee8-447535897847","resolution":{"observed_at":"2026-08-10T19:29:58.220334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.196604Z","title":"Bloom: A 176b-parameter open-access multilingual language model","venue":null,"work_id":"bb4fc626-7ff1-4e20-bc9a-fb3af96a0763","year":2023},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.362293Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:e0215334a541ad4dab539e1ba2eee30545be40558b67334caea419642e2e3167","observation_id":"46eac479-8591-4048-99c4-f9ce8f111840","resolution":{"observed_at":"2026-08-10T19:29:58.202937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.179453Z","title":"Losparse: Structured compression of large language models based on low-rank and sparse approximation","venue":null,"work_id":"c85d6cf4-a2d7-484e-823f-41009c177dfa","year":2023},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.367211Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:a7f4bffcc132710e8c3ffc734e96b55c012d1ea792a88ef34fda24be99aca178","observation_id":"6f325b37-05c8-47d8-9ace-ba2c8e724dd9","resolution":{"observed_at":"2026-08-10T19:29:58.184963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.162880Z","title":"A method for calculating the deriva- tive of activation functions based on piecewise linear approximation","venue":null,"work_id":"e4d67c5f-dd1d-46fc-9996-7212b17a0801","year":2023},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.372077Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:9f0586d6e32544814d9957b58fb5bef8282a70f1a2f10147461dd18d95c9a0eb","observation_id":"2abd438c-11be-4ea1-8af6-a31b7b742fe9","resolution":{"observed_at":"2026-08-10T19:29:58.168198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.146399Z","title":"Awq: Activation- aware weight quantization for on-device llm compres- sion and acceleration","venue":null,"work_id":"2b89f9e6-58c4-46f1-8f51-26884a9e52b2","year":2024},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.377928Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:3fc2b156e64a5a7828ee7bb8662aa1cea04bded3d792dbb98222586defe543df","observation_id":"78b89c51-3c3d-4ab5-97e9-b9f7f859bc78","resolution":{"observed_at":"2026-08-10T19:29:58.151675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:57.382810Z","title":"Deja vu: Con- textual sparsity for efficient llms at inference time","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.382810Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:0436c714f4e1fb3d12ab5e7609d2f54f21923e327866da455bd1322e91c514c6","observation_id":"c0b0bb5e-2b4f-4781-8d1a-e1987cdb7b8b","resolution":{"observed_at":"2026-08-10T19:29:57.382810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.117984Z","title":"Llm- pruner: On the structural pruning of large language mod- els","venue":null,"work_id":"4b49b4a7-14df-4649-b921-d688e70a1466","year":2023},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.387784Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:8c9ab2a70f043817441d5de2ff95c099b238441975e60a5e01b563cadd642166","observation_id":"2e129649-d204-4878-9880-b13ae5e80f01","resolution":{"observed_at":"2026-08-10T19:29:58.123371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.099680Z","title":"The penn treebank: an- notating predicate argument structure","venue":null,"work_id":"780bab9b-34d2-4ed8-98ed-f825e08317e2","year":1994},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.393108Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:484426b0672e5e6c6c374df2148fd5bba24b06309b949e5433981ed303f93eeb","observation_id":"18ebb02b-b103-4fac-93df-5ede178bdc9d","resolution":{"observed_at":"2026-08-10T19:29:58.106322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-10T19:29:57.398462Z","title":"Pointer sentinel mixture models","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.398462Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:652f8388738e55f12da43076e1a89634a72b53c6f1c16ed4f183d7ba2357c236","observation_id":"ff2b605b-e130-4127-a010-9f2274bc6588","resolution":{"observed_at":"2026-08-10T19:29:57.398462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.081141Z","title":"Relu strikes back: Exploiting activation sparsity in large language models","venue":null,"work_id":"16e58bd2-c349-4bbb-82d8-f5d4794d6400","year":2024},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.404970Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:8be3b4e0d104bb3dd4d42da84f11f0f0c3e633dd240eb15b8b01a913c4b0014d","observation_id":"0d11ea08-45f2-4d27-8897-e34db63e4800","resolution":{"observed_at":"2026-08-10T19:29:58.086389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.065158Z","title":"Implementation of a digital neuron with nonlinear activation function using piecewise linear approximation technique","venue":null,"work_id":"57bd6ebb-c55b-4bde-be1a-e4f2a7d877cd","year":2007},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.410416Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:a259719a133ee8352093d26b34fd4f97c1aa6222d8eb2a29ed155ba8ea25cf26","observation_id":"e100caf0-bd02-4053-a847-c090aa904677","resolution":{"observed_at":"2026-08-10T19:29:58.070531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.050178Z","title":"On estimation of a probability den- sity function and mode","venue":null,"work_id":"a74f1904-e868-4974-8c0f-988a3ef1c0e1","year":1962},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.415544Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:f1f231f2d527e60ecfea13d928d605c8d6136df6291ae59f5652023579c38646","observation_id":"46d902b8-e5af-4a9b-914c-f5884ea100a3","resolution":{"observed_at":"2026-08-10T19:29:58.055043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.034682Z","title":null,"venue":null,"work_id":"316fc64f-ef73-4da5-9fb0-e4dc4e4329d3","year":2020},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.420620Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:bde7ebd916ba97d5564237669ca7b97c9ec2b848fa48c864b48f77d5be0ecd4f","observation_id":"5f6f5a42-0057-40da-8706-9c5f87352fcc","resolution":{"observed_at":"2026-08-10T19:29:58.039765Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.017918Z","title":"Ma- trix compression via randomized low rank and low pre- cision factorization","venue":null,"work_id":"b91e99f0-9c6b-4163-b322-6f49c812f83d","year":2023},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.425252Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:2bd52e34328af4c9cacd3e21e7d899c9c39e164f26b04c74948896e0b734ccc7","observation_id":"fc26d064-0da5-4483-9ead-a1bae1cf91bb","resolution":{"observed_at":"2026-08-10T19:29:58.023503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:57.430539Z","title":"Glu variants improve transformer, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.430539Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:521980fb2eabd21db58df477a6ae222ba23621725b3937a16d5b65cf666a334e","observation_id":"d986af69-3217-4710-9389-ec1baf7816b8","resolution":{"observed_at":"2026-08-10T19:29:57.430539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:57.988000Z","title":"Powerinfer: Fast large language model serving with a consumer-grade gpu","venue":null,"work_id":"d28107ef-3efd-419a-a5f2-0081d44a3f55","year":2024},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.435269Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:7a2381c8ed7c1e91fdbc7700e53f7a4dfd0869e78874868ca587bb18ce18f2c8","observation_id":"20f0c52a-d450-469e-ab28-166c9950f701","resolution":{"observed_at":"2026-08-10T19:29:57.993947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:57.970492Z","title":"A simple and effective pruning approach for large lan- guage models","venue":null,"work_id":"e1e227fb-f9e2-408a-bdbb-7841669e14ce","year":2024},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.439797Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:008632d0d3b814dc72e018effc79188228f6e86918b3cb696578e2ead5497ccf","observation_id":"71785d44-2d13-4158-8154-fe9dea67d553","resolution":{"observed_at":"2026-08-10T19:29:57.975790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:57.953940Z","title":"Variable kernel density estimation","venue":null,"work_id":"d336aa75-5dbe-4aa9-9121-7f3ef00c0476","year":1992},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.444467Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:6360bb2131771a865b396e594aca246551af881be8c64837f0d57cb2ac52cff9","observation_id":"87730f5e-6e14-4f50-8332-7167b5ca0885","resolution":{"observed_at":"2026-08-10T19:29:57.959140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02019","last_updated":"2023-10-24T17:58:42Z","snapshot_observed_at":"2026-08-13T10:40:59.072764Z","submitted_at":"2023-08-03T20:20:01Z","title":"Baby Llama: knowledge distillation from an ensemble of teachers trained on a small dataset with no performance penalty","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02019","snapshot_observed_at":"2026-08-10T19:29:57.449262Z","title":"Baby llama: knowledge distillation from an ensemble of teachers trained on a small dataset with no performance penalty","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.449262Z"},"links":{"cited_paper":"/paper/2308.02019","citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:0c1cbf3ad8189825de1eff5c727573979a6e4ca18ab3d625e06166683eec498f","observation_id":"9e34aa2c-5175-4468-b5a0-c474dde97254","resolution":{"observed_at":"2026-08-10T19:29:57.449262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:57.935740Z","title":"Norm (mathemat- ics) - wikipedia, 9 2004","venue":null,"work_id":"053860c8-9dd1-46fc-8abb-4c6e9110f6a4","year":2004},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.454472Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:4162363553a5d159cbb28b36f68716e36a5ca4e39465a121581af63fc8f49922","observation_id":"c9cb247a-04b8-46ed-907b-da86dcfe1aac","resolution":{"observed_at":"2026-08-10T19:29:57.942046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:57.917547Z","title":"Llama: Open and efficient foun- dation language models, 2023","venue":null,"work_id":"77c1051e-98ab-47ba-a39e-c01385a0c966","year":2023},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.459332Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:60acb5ade32b11816fab13da2872a70bc02b560dbaf455ba37ded1e0c19fcc6d","observation_id":"5d5e99fd-5c1c-4bd4-a127-7de77fb525ce","resolution":{"observed_at":"2026-08-10T19:29:57.923335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09748","last_updated":"2024-02-15T06:58:30Z","snapshot_observed_at":"2026-08-13T04:18:34.574769Z","submitted_at":"2024-02-15T06:58:30Z","title":"Model Compression and Efficient Inference for Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09748","snapshot_observed_at":"2026-08-10T19:29:57.464280Z","title":"Model compression and efficient inference for large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.464280Z"},"links":{"cited_paper":"/paper/2402.09748","citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:d6a1a9b9a4abf369f561b7a19d08efe8e0f0a440d7e68bf01ed42abb07d03797","observation_id":"b0d9b4fa-f029-4ca5-ba28-14f4c28ee7d3","resolution":{"observed_at":"2026-08-10T19:29:57.464280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09145","last_updated":"2023-10-23T08:48:31Z","snapshot_observed_at":"2026-08-13T12:00:00.178824Z","submitted_at":"2023-04-18T17:34:23Z","title":"Outlier Suppression+: Accurate quantization of large language models by equivalent and optimal shifting and scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09145","snapshot_observed_at":"2026-08-10T19:29:57.469890Z","title":"Outlier suppression+: Accurate quantization of large language models by equivalent and optimal shifting and scaling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.469890Z"},"links":{"cited_paper":"/paper/2304.09145","citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:637e5d6d6ae9f9fca4373594f65ec8f7507642093b9ec44f410f383081723a24","observation_id":"c208a281-ae88-4a78-8607-fa24e89187bb","resolution":{"observed_at":"2026-08-10T19:29:57.469890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08092","last_updated":"2024-09-23T07:37:34Z","snapshot_observed_at":"2026-08-13T04:42:19.813596Z","submitted_at":"2024-01-16T03:35:26Z","title":"A Survey of Resource-efficient LLM and Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08092","snapshot_observed_at":"2026-08-10T19:29:57.474897Z","title":"A survey of resource- efficient llm and multimodal foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.474897Z"},"links":{"cited_paper":"/paper/2401.08092","citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:89c946805067be97ff807e84221a119c942b6eb63dfda62b23e4b58691d7bf14","observation_id":"196022ff-cf7d-4578-ba83-6afb1afda3c3","resolution":{"observed_at":"2026-08-10T19:29:57.474897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-10T19:29:57.479865Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.479865Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:fb5af88d7dbe0fec30f1bd07b479f8cbdd84902ec75472420dc2173f78ad0751","observation_id":"d809c6b8-c51d-4e3d-a727-71dfc47701ed","resolution":{"observed_at":"2026-08-10T19:29:57.479865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:57.900068Z","title":"Llmcbench: Benchmarking large language model compression for efficient deployment","venue":null,"work_id":"257042b7-d018-4441-86d7-ebbd50536af7","year":2024},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.484935Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:d033fe6cd5fbd042f5bf4b73867c56802974f2125a4c4de6401ebb518bbce64f","observation_id":"c1f05672-b123-4df4-a139-3846fb852591","resolution":{"observed_at":"2026-08-10T19:29:57.905501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:57.490516Z","title":"Zeroquant: Efficient and affordable post-training quantization for large-scale transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.490516Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:a8f11009fba1cf66cffba732931c3f74f6b2d2542cff861c86dfd155ff15768f","observation_id":"880d2a4f-b811-4098-81fe-7d2af96ea0c1","resolution":{"observed_at":"2026-08-10T19:29:57.490516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:57.870935Z","title":"Outlier weighed layerwise sparsity (OWL): A missing secret sauce for pruning LLMs to high sparsity","venue":null,"work_id":"56051a8a-93dc-4a28-8e61-41cd66ab7472","year":2024},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.495499Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:7ac3a387a38f5980cb424864ec5e8117b39335ba3414734f4a5089b996d10afe","observation_id":"b61e8c3d-98b9-45e5-b58f-7bab992c0e90","resolution":{"observed_at":"2026-08-10T19:29:57.877191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05981","last_updated":"2024-11-18T20:18:32Z","snapshot_observed_at":"2026-08-12T23:46:47.221477Z","submitted_at":"2024-06-10T02:47:55Z","title":"ShiftAddLLM: Accelerating Pretrained LLMs via Post-Training Multiplication-Less Reparameterization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05981","snapshot_observed_at":"2026-08-10T19:29:57.500991Z","title":"Shiftaddllm: Accelerat- ing pretrained llms via post-training multiplication-less reparameterization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.500991Z"},"links":{"cited_paper":"/paper/2406.05981","citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:30e0719d2d4a90711b68e95b500380b33eb1421ad4b3e6c1852ef9bfc8b9b969","observation_id":"a7f3fe86-1afd-43a3-9585-2e055337003d","resolution":{"observed_at":"2026-08-10T19:29:57.500991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:57.853170Z","title":"A novel sigmoid function approx- imation suitable for neural networks on fpga","venue":null,"work_id":"9825a628-4a62-4a39-a95b-3d588febc262","year":2019},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.506575Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:a273466055bc0b46a07e2d82f820da9b4da5f9773c80143d6b6a5f8e3cb9fe6e","observation_id":"ae8c5ab6-16aa-4c53-8d15-ab52856f56d3","resolution":{"observed_at":"2026-08-10T19:29:57.858841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:57.835266Z","title":"Inves- tigating layer importance in large language models","venue":null,"work_id":"828453af-0a47-429e-a268-c7bf5cf6a4f2","year":2024},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.512331Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:b41797156512c3ad9988c2071b8bfc7fa374b5a6435fe965bfe5ad7b8ae24a3f","observation_id":"e6207a2a-4e7b-49e9-a5c3-422b04599a81","resolution":{"observed_at":"2026-08-10T19:29:57.841083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:57.816384Z","title":"Plug-and-play: An efficient post-training pruning method for large lan- guage models","venue":null,"work_id":"d53397b4-703a-4bce-8916-659e302b17ce","year":2024},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.517543Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:39bad1a8d4a7af4c8cebf9447eafb31e80690fa723d8aee98eef44ce07519af0","observation_id":"c3fd90f2-2ebd-4c22-aec3-8dbf4e0f84e1","resolution":{"observed_at":"2026-08-10T19:29:57.823674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14294","snapshot_observed_at":"2026-08-10T19:29:57.522816Z","title":"A survey on efficient inference for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.522816Z"},"links":{"cited_paper":"/paper/2404.14294","citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:ce9da28fab5fdf89d0b0f2808108ea37cfa23456c5cf843d5780f99de8bb1962","observation_id":"16628c73-4829-48be-bc05-9294ae5df128","resolution":{"observed_at":"2026-08-10T19:29:57.522816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:29:58.505501Z","title":null,"venue":null,"work_id":"6e36a9c9-2069-4a20-b481-3411e43b0a70","year":2025},"citing_paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:57.231369Z"},"links":{"citing_paper":"/paper/2501.10054"},"observation_digest":"sha256:fe51c4d71ba2fabc18d1843bf81ba856aaa95ccb328cf1e43e9b6f5bfeae8439","observation_id":"0f360ec6-00c8-4083-9147-66736c8aa1f8","resolution":{"observed_at":"2026-08-10T19:29:58.514100Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.10054","last_updated":"2025-01-17T09:20:56Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T19:21:21.883103Z","submitted_at":"2025-01-17T09:20:56Z","title":"Accelerating Large Language Models through Partially Linear Feed-Forward Network"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":46},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:2501.10054."}