{"as_of":"2026-08-07T11:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2f7196d6bb0d3cc5ab97e703f20867ac5f965ce5c433a0c53422f354e87aa128","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T16:03:38.453321Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.19087/citation-record","integrity":"/paper/2508.19087/integrity","json":"/paper/2508.19087/citation-record.json","paper":"/paper/2508.19087"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-03T04:49:15.195814Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-05T16:03:29.940257Z","title":"Sparks of artificial general intelligence: Early exper- iments with gpt-4,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:29.940257Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:d2f439e99144b8aa625ec20a45326fc9146b863c438d3d17f859ce1632748101","observation_id":"2c0249ee-648e-420a-b3af-852c7066a201","resolution":{"observed_at":"2026-08-05T16:03:29.940257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T16:03:30.103343Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:30.103343Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:25f51ba02efd88180eb9df2d95712be41d33bb9d9649dff0704b9ed6cb93895c","observation_id":"0699aa5c-7ee9-4474-839f-22467db1afb1","resolution":{"observed_at":"2026-08-05T16:03:30.103343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-05T16:03:30.247494Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:30.247494Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:7391553323dfe8e7a4d29ff24e250ca442ef6be1381b7a757333a99a53222195","observation_id":"f1046ed7-e9ae-4b3d-8fc0-ad7eac3940fa","resolution":{"observed_at":"2026-08-05T16:03:30.247494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T16:03:30.430398Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:30.430398Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:a1f60fa069b27c3115b427a471fddf2ff3d1cb9178b092238e17fd9af0cb0daa","observation_id":"20b2debd-4947-433b-b75d-e7d68e19e71d","resolution":{"observed_at":"2026-08-05T16:03:30.430398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:52.602114Z","title":"Jumping nlp curves: A review of natural language processing research,","venue":null,"work_id":"7a4a88a5-8a65-4eb6-8058-cde7be7d1052","year":2014},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:30.620469Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:e29e9258d74e77b311619c0571da3eb4a9c691cafe445c90b6513fcfb957b65b","observation_id":"de9a7b54-2bdf-4117-ad18-fa77863d036e","resolution":{"observed_at":"2026-08-05T16:03:52.699089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T16:03:30.727386Z","title":"Scaling laws for neural language models,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:30.727386Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:60ea48b0ac5fec7067cb2f733034adf30e32c19b6f3f990adc8cdb80ccea35aa","observation_id":"21a7223a-8da9-4462-b25f-84ba27760508","resolution":{"observed_at":"2026-08-05T16:03:30.727386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:52.277302Z","title":"Chateda: A large language model powered autonomous agent for eda,","venue":null,"work_id":"1d8809b2-19b4-4e9e-957a-b15f2f9d1e11","year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:30.864703Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:fa8fec1aa5a4d77516728712d93d4be4b408942158a637bb7bae686074fbfa02","observation_id":"3a9c9fab-7b3c-42e3-a932-c722a16c76a3","resolution":{"observed_at":"2026-08-05T16:03:52.411263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:52.099646Z","title":"Dtatrans: Leveraging dynamic token-based quantization with accuracy compensation mechanism for efficient transformer archi- tecture,","venue":null,"work_id":"ca98d0fe-5099-498a-b0b3-9bb14620a746","year":2022},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:30.971935Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:9c5fafd7a9e21048d3e2637bc748b3d28a63398a4f66ac583b7738ba4b89e70f","observation_id":"97ec05cb-66d7-42cd-be3c-4883c458397a","resolution":{"observed_at":"2026-08-05T16:03:52.188830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:51.804631Z","title":"Qlora: Efficient finetuning of quantized llms,","venue":null,"work_id":"564b550b-623d-4337-a22e-455c71f2cf4e","year":2023},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:31.093906Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:2024a0ca70d7c7ef23af5424071fa9969e375c9491ce1b153c6350e9b6cac558","observation_id":"285e7a34-e16c-40b1-9d04-e41ec4daf6e7","resolution":{"observed_at":"2026-08-05T16:03:51.958128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:51.581058Z","title":"Optq: Accurate quantization for generative pre-trained transformers,","venue":null,"work_id":"b5b170c0-c462-4279-8036-679070f01efb","year":2023},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:31.247082Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:277e5fbcd0e413274f1560c401ca93349e113cb9788224f2fc58477dbf1d07c7","observation_id":"2a09aa32-f0e9-43b3-892a-b2d5ffa42574","resolution":{"observed_at":"2026-08-05T16:03:51.665625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:51.438665Z","title":"A precision-scalable risc-v dnn processor with on- device learning capability at the extreme edge,","venue":null,"work_id":"adc24fcb-21ec-4d2a-b7fb-5c247dd17878","year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:31.362494Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:401ad3bd94579950a6bddc9e08c93c3e2448aac88c6ad99755ffdbb10408094f","observation_id":"53251243-f0e0-4ebd-ac71-deab2d1b995a","resolution":{"observed_at":"2026-08-05T16:03:51.518375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:51.197889Z","title":"Token-scaled logit distillation for ternary weight gen- erative language models,","venue":null,"work_id":"33eefc41-28a8-4b87-ad7c-c05a38eb5cbb","year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:31.478915Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:f62ab0cffcc4514d52a0bf1ab573f5204f638e39717f227369655360650a02d4","observation_id":"e942cdf7-30a4-4ea2-8417-6779523368fe","resolution":{"observed_at":"2026-08-05T16:03:51.335615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11295","last_updated":"2024-11-29T11:47:55Z","snapshot_observed_at":"2026-07-06T17:31:37.574049Z","submitted_at":"2024-02-17T14:26:57Z","title":"OneBit: Towards Extremely Low-bit Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11295","snapshot_observed_at":"2026-08-05T16:03:31.642699Z","title":"Onebit: Towards extremely low-bit large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:31.642699Z"},"links":{"cited_paper":"/paper/2402.11295","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:4f2915e43544e8ee5d27e07146f4bb8c7a614e612ddad498e45787ee46c52945","observation_id":"7715ab1b-072b-4683-af15-09bc88d460a3","resolution":{"observed_at":"2026-08-05T16:03:31.642699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:50.943277Z","title":"Smoothquant: Accurate and efficient post-training quantization for large language models,","venue":null,"work_id":"22daa5a4-0e94-4a0e-b532-2fbceb472672","year":2023},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:31.776902Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:a74772133d6aa63880ab26c66efcb12f3348e5a824a52fc27c9f9755410d9a6d","observation_id":"34a9228e-f7c6-4f26-9ea9-ffa5b255dbc8","resolution":{"observed_at":"2026-08-05T16:03:51.062987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:50.659888Z","title":"Omniquant: Omnidirectionally calibrated quantization for large language models,","venue":null,"work_id":"abb3de9b-a1e6-49ac-8701-0efba08433e0","year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:31.837782Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:f82944d9e9e3d153b8e1220f7a361cf78372468b650364fcd06513274e2d0848","observation_id":"2dbe31b4-d068-44b5-8d19-b14b892fff01","resolution":{"observed_at":"2026-08-05T16:03:50.801835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:50.299543Z","title":"Holes: Boosting large language models efficiency with hardware-friendly lossless encoding,","venue":null,"work_id":"f89c4fd7-1e62-4b4b-8ea4-be1ac113c7b1","year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:31.893683Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:816561e109258dd292f6939625d46f517fda86a1cf449f64fac55713a03eb9a0","observation_id":"e29de1d8-be67-4cc6-a866-00e42673bd77","resolution":{"observed_at":"2026-08-05T16:03:50.513827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:50.090249Z","title":"Quantization via distillation and contrastive learning,","venue":null,"work_id":"c5a755e7-ae47-4946-9674-ba1e21c75861","year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:32.017450Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:8c1f8a10a8f4efdd8b1bec6bbbc2bb7aa25ad956ee045dc33af30729d754775a","observation_id":"81e59714-90dc-4fd5-b33f-69d73af0889c","resolution":{"observed_at":"2026-08-05T16:03:50.218760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:49.799274Z","title":"Atom: Low-bit quantization for efficient and accurate llm serving,","venue":null,"work_id":"d1722dbe-05a8-4610-85e0-83ed1ad99c80","year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:32.133751Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:2fca0f4ec415bd4c621c54df7256d793e9ea356cb199319cf844817f2c12e6c5","observation_id":"a347db84-0d13-4c1c-bfb1-733796f494e4","resolution":{"observed_at":"2026-08-05T16:03:49.940044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:49.517494Z","title":"Nvidia a100 tensor core gpu: Performance and innovation,","venue":null,"work_id":"3728f8bb-2889-4d5f-b348-b09b66279695","year":2021},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:32.231960Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:24e8f2f28c4e11780cac2f5a5132678cac6ed1cc5e2411dc84118e5cba373e06","observation_id":"78e738c1-ebaa-4270-bd8e-f0f32a7b3542","resolution":{"observed_at":"2026-08-05T16:03:49.644008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:49.214126Z","title":"Rtx on—the nvidia turing gpu,","venue":null,"work_id":"f1800657-9004-488b-a411-4482065360ad","year":2020},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:32.311442Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:73ed5a20e835ef400f44704ec9b88912965f0a0ff305d0678586cf52a33657e4","observation_id":"8b2eb790-87f0-4345-95e9-5dad8cc06a8c","resolution":{"observed_at":"2026-08-05T16:03:49.365835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:48.872778Z","title":"Dissecting tensor cores via microbenchmarks: Latency, throughput and numeric behaviors,","venue":null,"work_id":"0f6fb2de-f67e-41c8-aaba-9b880d7b8f78","year":2022},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:32.488863Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:a7942750cf8964bae5fdee96de76d8942e91f871fbe11989f66e67cf552d85af","observation_id":"61402a7a-7864-4591-806f-256035d61ed8","resolution":{"observed_at":"2026-08-05T16:03:49.070155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04532","last_updated":"2025-05-01T02:14:05Z","snapshot_observed_at":"2026-07-06T18:11:09.767624Z","submitted_at":"2024-05-07T17:59:30Z","title":"QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04532","snapshot_observed_at":"2026-08-05T16:03:32.624554Z","title":"Qserve: W4a8kv4 quantization and system co-design for efficient llm serving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:32.624554Z"},"links":{"cited_paper":"/paper/2405.04532","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:759eb51fb535d48eb1c6294606940a211029142607fedf3512d9aa3f5893c46a","observation_id":"f6e2c64e-11de-4867-be05-59d2e3d3b060","resolution":{"observed_at":"2026-08-05T16:03:32.624554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:48.572685Z","title":"G-blastn: accelerating nucleotide alignment by graphics processors,","venue":null,"work_id":"67f54d37-b2f5-4da7-8757-1bcf6e83e54d","year":2014},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:32.713355Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:1141df41f12244b6a20351103f01aec02bbb6760c49972aa57e3e8ee6eb8f8ca","observation_id":"02687371-529f-495d-bdff-b1680de5b07c","resolution":{"observed_at":"2026-08-05T16:03:48.703589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:48.302744Z","title":"Accelerating performance of gpu-based workloads using cxl,","venue":null,"work_id":"a76e96b4-9ac7-40fc-9b20-5e2e8d1f9c03","year":2023},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:32.816745Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:e3a0d5d49c14ab2374e322ce462bd58ee014b374bf059715f206fadc217bec8f","observation_id":"972eb02e-45bf-4945-8ff3-c7891e9db510","resolution":{"observed_at":"2026-08-05T16:03:48.438897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:48.020987Z","title":"Superneurons: Dynamic gpu memory management for training deep neural networks,","venue":null,"work_id":"1c7bba4d-f611-4706-a300-8b7b3a136c14","year":2018},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:32.903184Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:71f3bce5f9d7fb65dd56bac403d4f18b322ffcab0faa8ed31e3fd433f14b479f","observation_id":"0d767571-b9e6-4997-b49f-ecf36bb09708","resolution":{"observed_at":"2026-08-05T16:03:48.156464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:47.654761Z","title":"Gpt3. int8 (): 8-bit matrix multiplication for trans- formers at scale,","venue":null,"work_id":"b65550c6-d27c-4fd5-b35f-7e6eaedabfeb","year":2022},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:33.026595Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:237d9534daad4e11ee864995ac37d40782488878a999b04592ac2bebd001f25c","observation_id":"862a8792-8b7c-43a0-9836-96f2dbbd69e9","resolution":{"observed_at":"2026-08-05T16:03:47.803596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:47.281746Z","title":"Quant-llm: Accelerating the serving of large language models via fp6-centric algorithm-system co-design on modern gpus,","venue":null,"work_id":"f0060fc2-55d3-425d-a444-29a66ca8eed1","year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:33.175416Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:0943017a5e2dcb23a653a48c349e82019053acfabd02cfe3a91a37f9ea34a978","observation_id":"a7457989-dce0-4e7f-9a58-7ff4d12c6b58","resolution":{"observed_at":"2026-08-05T16:03:47.454561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:46.895776Z","title":"Tsm2x: High-performance tall-and-skinny matrix– matrix multiplication on gpus,","venue":null,"work_id":"c7924025-46be-4974-ba6c-dc021bfa153e","year":2021},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:33.298313Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:9daa2ddcf5f6b22638f6447cb8f0bca5ecad3ffe633e6a5ff531261b08fe7598","observation_id":"caa6ff66-940d-461e-992b-d09fa11ae585","resolution":{"observed_at":"2026-08-05T16:03:47.084547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:46.530870Z","title":"Stream-k: Work-centric parallel decomposition for dense matrix-matrix multiplication on the gpu,","venue":null,"work_id":"6814978a-1eb1-4555-9f83-36c2000c90ba","year":2023},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:33.396338Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:6492972d28e8f03d562e8e0ea59f3efb4b48be9903c2f6d57450ae18e5cece2b","observation_id":"73a8173f-ae2d-4e27-a9a0-f835c17507ed","resolution":{"observed_at":"2026-08-05T16:03:46.669641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:46.122321Z","title":"Warp-aware adaptive energy efficiency calibration for multi-gpu systems,","venue":null,"work_id":"6909f9f0-8f80-4ec5-95a6-f5dd85a0aeac","year":2023},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:33.509043Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:2b151b8178a1e5304e74a633d0ec2fcc3d56bbcce632754d75fc55575dbe3b28","observation_id":"efedc03e-0a91-4e01-9a05-fab1cfa26ab3","resolution":{"observed_at":"2026-08-05T16:03:46.295684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:45.758101Z","title":"Dg-replace: A dataflow-driven gpu-accelerated an- alytical global placement framework for machine learning accelerators,","venue":null,"work_id":"6987816b-9a83-4fcf-a6fe-26cbe3c0b7ca","year":2025},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:33.711616Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:9d0bac7700b3df6c011899c10e991c14993c9416275739c9e2d302de9b8d3ddf","observation_id":"c55015c0-a37a-4ba3-991e-9e6c536392ab","resolution":{"observed_at":"2026-08-05T16:03:45.883712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:45.388995Z","title":"Enabling efficient sparse multiplications on gpus with heuristic adaptability,","venue":null,"work_id":"0834983d-3893-4c36-a150-009894402517","year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:33.821701Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:57829fd5286ca26311f5a1895c71645af95b16ed1418b585b70b5159d1b854c2","observation_id":"6a408321-96c9-44fb-8927-41f1b0f5f099","resolution":{"observed_at":"2026-08-05T16:03:45.519740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:45.092689Z","title":"Bstc: A novel binarized-soft-tensor-core design for acceler- ating bit-based approximated neural nets,","venue":null,"work_id":"becfc3d2-e32e-4dac-a180-3162268ab0ba","year":2019},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:33.927448Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:78a7a725032472c06e9ebc87f56ad0c75973d6a5ae19a71d340a21a7de54512b","observation_id":"f204c8cb-b910-4361-9f64-5ac40004a4c5","resolution":{"observed_at":"2026-08-05T16:03:45.169637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:44.802968Z","title":"Accelerating binarized neural networks via bit-tensor-cores in turing gpus,","venue":null,"work_id":"6c5225c4-e697-4c14-aa43-283bb67aa9d4","year":2020},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:34.072475Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:ec76e241ab078f3fbd75dbe980915c1d50e9e9c6100245b0b3015840ca26da77","observation_id":"1f0e1a3d-b951-4eec-9265-5029184e20fe","resolution":{"observed_at":"2026-08-05T16:03:44.917241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:44.554069Z","title":"Demystifying the nvidia ampere architecture through microbenchmarking and instruction-level analysis,","venue":null,"work_id":"5fad2146-3f53-4de1-86b7-9f25dfc15492","year":2022},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:34.214076Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:3039ab250bf5678deaf60fc40ad829652ff5140c9e390b390850645cba2c6cf1","observation_id":"a7657730-372d-442d-9efe-85a35fbaa7d5","resolution":{"observed_at":"2026-08-05T16:03:44.637710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.07486","last_updated":"2019-03-18T14:45:46Z","snapshot_observed_at":"2026-08-06T14:02:49.634846Z","submitted_at":"2019-03-18T14:45:46Z","title":"Dissecting the NVidia Turing T4 GPU via Microbenchmarking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.07486","snapshot_observed_at":"2026-08-05T16:03:34.362212Z","title":"Dissecting the nvidia turing t4 gpu via microbenchmark- ing,","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:34.362212Z"},"links":{"cited_paper":"/paper/1903.07486","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:94cf8faa074a5f5de7d3eccb053922aae7c64f4fdf48f46c6606bda19df2405b","observation_id":"ddd27145-4aa4-4b4e-bd39-8a1262afe34b","resolution":{"observed_at":"2026-08-05T16:03:34.362212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:43.912640Z","title":"Gtco: Graph and tensor co-design for transformer-based image recognition on tensor cores,","venue":null,"work_id":"de9bac7d-1d66-4aac-8557-b6c11c4a2c3d","year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:34.545982Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:d62511b2bdf545c40ba676ecc81d14e197f1fd06e0346fc3a60dd58d42229b45","observation_id":"c1cfc1ed-d322-48d7-9a5a-b4352db32e67","resolution":{"observed_at":"2026-08-05T16:03:44.121829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:43.676996Z","title":"Reducing shared memory footprint to leverage high throughput on tensor cores and its flexible api extension library,","venue":null,"work_id":"d0fdfcb3-0b0e-44be-901f-d6e8bcdad543","year":2023},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:34.626516Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:88ae9802e6440afeb7e0ad77f0a25eb182bacbcd6cee9debb3b920e73027b34d","observation_id":"10a85451-0f7f-44a6-b720-0855114b9c2a","resolution":{"observed_at":"2026-08-05T16:03:43.817709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:43.406316Z","title":"Tc-gnn: Bridging sparse gnn computation and dense tensor cores on gpus,","venue":null,"work_id":"ea3084ba-f683-4b54-91c9-b0a224be9479","year":2023},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:34.781504Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:979f427d0505f73c9779c4fd475ee0ea6d331cb8ae5ea479d508ad067917bf87","observation_id":"d3ba3b1d-64d2-4aac-80b0-1c17207ef002","resolution":{"observed_at":"2026-08-05T16:03:43.542363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14294","snapshot_observed_at":"2026-08-05T16:03:34.877201Z","title":"A survey on efficient inference for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:34.877201Z"},"links":{"cited_paper":"/paper/2404.14294","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:634a939b1d2c4ae71a747c9167a6cc6c14390f53b3d64a54bbd341ab88295e2b","observation_id":"bc41d50c-520f-4568-b483-fee0d23a90d6","resolution":{"observed_at":"2026-08-05T16:03:34.877201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13388","last_updated":"2024-03-12T00:32:05Z","snapshot_observed_at":"2026-07-06T17:33:08.817655Z","submitted_at":"2024-02-20T21:34:56Z","title":"Transformer tricks: Precomputing the first layer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13388","snapshot_observed_at":"2026-08-05T16:03:35.015302Z","title":"Transformer tricks: Precomputing the first layer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:35.015302Z"},"links":{"cited_paper":"/paper/2402.13388","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:51b1b16e71bef9517e2780f358ca770c7aba45a6a04e23cc0685822d54ef79b2","observation_id":"936e10d2-b8f9-432d-b9d3-406727c0d6b3","resolution":{"observed_at":"2026-08-05T16:03:35.015302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-05T16:03:35.155547Z","title":"Model tells you what to discard: Adaptive kv cache compression for llms,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:35.155547Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:d57dc594985257cbc097032dbff004c18a57273d602300464095db1145d122cd","observation_id":"20028b8c-8e9b-4be8-9aad-7f086a53eca0","resolution":{"observed_at":"2026-08-05T16:03:35.155547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:43.145616Z","title":"Efficiently scaling transformer inference,","venue":null,"work_id":"776d6edb-5594-49ed-bd40-53f6821feeb8","year":2023},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:35.276363Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:028a228349fb5693b4cfaa7eabeedcb223ffc1eb89ac714bd45be1f1d4d23a39","observation_id":"0384a01f-6700-410c-b846-6077e1f05f29","resolution":{"observed_at":"2026-08-05T16:03:43.271413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-05T16:03:35.382312Z","title":"Llm inference unveiled: Survey and roofline model insights,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:35.382312Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:fc80f043aa3b5cb3dcb08237553f20404b7712f62175d28f8e70974cf5bd42b2","observation_id":"50dbda44-73ad-4c8c-b464-a047058de65d","resolution":{"observed_at":"2026-08-05T16:03:35.382312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:42.880222Z","title":"Squeezellm: Dense-and-sparse quantization,","venue":null,"work_id":"22fed89e-9414-47c8-bc80-f6e497307653","year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:35.525034Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:f1b04862a88058894375076d974974edf8a18b9c9ce3890a8d688c88f75f3586","observation_id":"23f16808-6923-48eb-9bd2-dbfd81312a1f","resolution":{"observed_at":"2026-08-05T16:03:42.979238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:42.613821Z","title":"Quantsr: accurate low-bit quantization for efficient image super-resolution,","venue":null,"work_id":"0526e3f9-4636-4b7f-9075-18a9862c2f15","year":2023},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:35.654288Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:2ebf81fccff58dd1c04b45bbc31082ae5fcac4f880059df57444d3dbb86b8271","observation_id":"602f8122-5394-423d-9363-362753a53a0f","resolution":{"observed_at":"2026-08-05T16:03:42.735145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:42.314009Z","title":"Accurate lora-finetuning quantization of llms via infor- mation retention,","venue":null,"work_id":"edb4efe4-ab49-4820-8b3d-d09bbfa40b1e","year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:35.740233Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:db8c088f7dee31dd03d242b0c1223f2fc8343f618c2e1ddad3b5325d2ea79c38","observation_id":"8c9c4e4d-e22e-4f6a-a269-72f65297aff9","resolution":{"observed_at":"2026-08-05T16:03:42.456579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:42.022553Z","title":"Bimatting: Efficient video matting via binarization,","venue":null,"work_id":"9321b125-ce60-48fa-90e9-813a566cd36e","year":2023},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:35.795656Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:8f896959d7ad1e63cb5b39dcf77d86150f525daa8af7d13ef66c2f7a2968526b","observation_id":"aa6adcfe-69e2-4d00-bdd2-aa522c72ac1a","resolution":{"observed_at":"2026-08-05T16:03:42.173545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:41.706454Z","title":"Bibert: Accurate fully binarized bert,","venue":null,"work_id":"0692e35e-c8a5-4b3c-9513-a6a90c02992b","year":2022},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:35.926778Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:62ab2bf96d148f460b4d4a1a718fe4b2401b22509854230a50e36754f41ca0b4","observation_id":"dc0e5c26-be37-45c6-a541-59cffa191625","resolution":{"observed_at":"2026-08-05T16:03:41.854183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:41.398739Z","title":"Bebert: Efficient and robust binary ensemble bert,","venue":null,"work_id":"061ddde6-acec-4688-bc4f-6e8cadfcff86","year":2023},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:36.063989Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:3a82edaefaa0aeaa1e120d653abf12c95a8e0a92f7d73e173337a43f76288688","observation_id":"6b77b327-62a3-4095-bb3d-bf53d3e02ad0","resolution":{"observed_at":"2026-08-05T16:03:41.556430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:41.183086Z","title":"Anda: Unlocking efficient llm inference with a variable- length grouped activation data format,","venue":null,"work_id":"8c5f037b-c4cc-4501-bd94-e247aabf4b97","year":2025},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:36.192211Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:72c300d527e440d8222c583398a6f1ece4f3d9c5a08b3c888a82c2d859b4fe16","observation_id":"febe2237-c4f7-4ba0-bdb7-eb4f062c9e7f","resolution":{"observed_at":"2026-08-05T16:03:41.285241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:40.915286Z","title":"Binaryconnect: Training deep neural networks with binary weights during propagations,","venue":null,"work_id":"64bd0c3d-3c09-4325-b12a-e3aa1a8a437a","year":2015},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:36.289139Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:84e43391cd6a72284095148dff85d847bc3141bbbaa44c1845efd3dc514eabf8","observation_id":"e934cee2-b33f-4156-9766-e77fc31f79e5","resolution":{"observed_at":"2026-08-05T16:03:41.038528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:40.660270Z","title":"Apnn-tc: Accelerating arbitrary precision neural net- works on ampere gpu tensor cores,","venue":null,"work_id":"641133cd-3129-4ef7-999a-fa8901c9a52e","year":2021},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:36.427395Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:c8726e27d02cff192f87690ff087e94c737470201b393dc714d70f124cb9597b","observation_id":"32badd89-5357-4eb1-bf96-f3abad82b614","resolution":{"observed_at":"2026-08-05T16:03:40.746968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:40.417863Z","title":"O3bnn: An out-of-order architecture for high- performance binarized neural network inference with fine-grained prun- ing,","venue":null,"work_id":"39508b3c-4ead-4b69-b000-ee9653be6953","year":2019},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:36.587831Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:836c2575979ca0b491c21da1de2aa3eda596408b562d2e4053f98f7a61f420f1","observation_id":"85c7506c-6611-476b-bd56-2eafefebde65","resolution":{"observed_at":"2026-08-05T16:03:40.550324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:40.168263Z","title":"O3bnn-r: An out-of-order architecture for high- performance and regularized bnn inference,","venue":null,"work_id":"f3fd10a3-2a1e-40b0-beb6-38cdebd0a684","year":2020},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:36.716924Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:3f15d637a48795cb47e935b47f774ed000130a91316a4907009723e888869800","observation_id":"2e159bb0-57f2-4c08-8b4a-a89501d8ca9f","resolution":{"observed_at":"2026-08-05T16:03:40.290730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1510.00149","last_updated":"2016-02-15T06:25:40Z","snapshot_observed_at":"2026-08-04T16:59:47.843960Z","submitted_at":"2015-10-01T09:03:44Z","title":"Deep Compression: Compressing Deep Neural Networks with Pruning, Trained Quantization and Huffman Coding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.00149","snapshot_observed_at":"2026-08-05T16:03:36.820892Z","title":"Deep compression: Compressing deep neural networks with pruning, trained quantization and huffman coding,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:36.820892Z"},"links":{"cited_paper":"/paper/1510.00149","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:957981b63c1cf7115f950bc7a916dd87922ae5bd7f421806eb53026195287bfb","observation_id":"a82f4c78-4e48-4753-9e7d-fca5a7664637","resolution":{"observed_at":"2026-08-05T16:03:36.820892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:39.922884Z","title":"Energy-efficient neural network accelerator based on outlier-aware low-precision computation,","venue":null,"work_id":"7cac18ee-d07e-459c-8bae-aa7902197a2e","year":2018},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:36.973470Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:d82e9a2f230e5c304ca1219965d8bcb5d6d0f5bdf51dbb27b2e331bc400a336d","observation_id":"d6f7676a-04bf-4c3b-9020-9fc997bb10ac","resolution":{"observed_at":"2026-08-05T16:03:40.054971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:39.744337Z","title":"Haq: Hardware-aware automated quantization with mixed precision,","venue":null,"work_id":"4431fd04-ba72-481f-aa04-abe54f1cd8c9","year":2019},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:37.059456Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:d1cb535a3bb431db51776c461d1add6327a4e2bb69c093ac9542117989e42807","observation_id":"beb297e3-6573-4407-8cf0-a383adc8e25b","resolution":{"observed_at":"2026-08-05T16:03:39.822948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:39.411740Z","title":"Lq-nets: Learned quantization for highly accurate and compact deep neural networks,","venue":null,"work_id":"7b4252bf-2fff-4668-b237-5a6fabbece38","year":2018},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:37.163159Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:65fe28ffb520c26a2b06698297c77a8cd14a6d9ce0a9306bd6816260fc4f11f1","observation_id":"2f35f174-06ed-4ec5-90b4-044f816a4ede","resolution":{"observed_at":"2026-08-05T16:03:39.574486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06160","last_updated":"2018-02-02T01:43:54Z","snapshot_observed_at":"2026-07-06T05:00:35.763958Z","submitted_at":"2016-06-20T15:02:31Z","title":"DoReFa-Net: Training Low Bitwidth Convolutional Neural Networks with Low Bitwidth Gradients","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06160","snapshot_observed_at":"2026-08-05T16:03:37.317001Z","title":"Dorefa-net: Training low bitwidth convolutional neural networks with low bitwidth gradients,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:37.317001Z"},"links":{"cited_paper":"/paper/1606.06160","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:9c06b503abd2f6b397b4784b9adf5a0620bbeda0e30eb970594ef66072731102","observation_id":"ed54c9ca-a242-4b44-ad33-9e83c77fd0f8","resolution":{"observed_at":"2026-08-05T16:03:37.317001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T16:03:37.480444Z","title":"Bitnet: Scaling 1-bit transformers for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:37.480444Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:f2abedf386d9e4aae1cc09fb7bf36262b2b8ee479ccb36e0c65b86ea36a98777","observation_id":"64b701fa-203f-4860-86af-cb433ba3e196","resolution":{"observed_at":"2026-08-05T16:03:37.480444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:39.202548Z","title":"CUTLASS,","venue":null,"work_id":"4dbfa243-3c2f-46c0-989a-ade59dd67329","year":2023},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:37.615424Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:aa9ed4df854c014d258ade223630fc7df9aa00b9eaada57412e3ed8bae671473","observation_id":"c4a7e274-a1e0-4630-8f06-594cc0e859fa","resolution":{"observed_at":"2026-08-05T16:03:39.296976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16954","last_updated":"2024-11-25T21:47:23Z","snapshot_observed_at":"2026-07-06T19:56:57.022021Z","submitted_at":"2024-11-25T21:47:23Z","title":"Understanding GEMM Performance and Energy on NVIDIA Ada Lovelace: A Machine Learning-Based Analytical Approach","version":1},"cited_work":{"arxiv_id":"2411.16954","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.16954","snapshot_observed_at":"2026-08-05T16:03:38.623641Z","title":"Understanding GEMM Performance and Energy on NVIDIA Ada Lovelace: A Machine Learning-Based Analytical Approach","venue":"cs.DC","work_id":"c9afeed8-6303-40f6-9d86-7fb673750811","year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:37.761446Z"},"links":{"cited_paper":"/paper/2411.16954","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:500f840b15532291760a72658074326695c703951ba55acc325d141ba524f2c1","observation_id":"8b8e1fab-3214-4f98-ab05-99f3338c3ecd","resolution":{"observed_at":"2026-08-05T16:03:38.709223Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:44.270389Z","title":"Benchmarking and dissecting the nvidia hopper gpu architecture,","venue":null,"work_id":"426559fa-bb71-4f04-9ae5-810a21011805","year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:37.863736Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:45ad675dadd31ee509f9e0ce58ba3be53e38227e9329c2ec315a2812bbb019c0","observation_id":"647c40c9-853c-4d34-83ae-be0dbcf3c981","resolution":{"observed_at":"2026-08-05T16:03:44.427189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T16:03:37.961793Z","title":"Qwen2. 5 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:37.961793Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:8c5c6fb69c82617b7228a484baeec005d0a4af6acae1c02c7710f8b13274632c","observation_id":"218ea8a5-470c-47c8-9151-ce529186440c","resolution":{"observed_at":"2026-08-05T16:03:37.961793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-05T16:03:38.057130Z","title":"Opt: Open pre-trained transformer language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:38.057130Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:a77f69b06369c1f5f84f18bcbf8ed0976323377ac1e2028e074d3a46cac3854c","observation_id":"23525f4e-8c54-465c-9ef4-0e17cad9dccd","resolution":{"observed_at":"2026-08-05T16:03:38.057130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05100","last_updated":"2023-06-27T09:57:58Z","snapshot_observed_at":"2026-08-04T18:56:03.233715Z","submitted_at":"2022-11-09T18:48:09Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05100","snapshot_observed_at":"2026-08-05T16:03:38.218549Z","title":"Bloom: A 176b-parameter open-access multilingual language model,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:38.218549Z"},"links":{"cited_paper":"/paper/2211.05100","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:b34bca41be7afa23002976f48daf07a18f75c8aa1d8a25a4d9e5f314605c3c3c","observation_id":"372fa1e2-d486-4352-ad8f-e8c613a2b8e1","resolution":{"observed_at":"2026-08-05T16:03:38.218549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:03:38.985231Z","title":"Quarot: Outlier-free 4-bit inference in rotated llms,","venue":null,"work_id":"c67129d5-c1a5-4913-93e2-873ad1169d8f","year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:38.331692Z"},"links":{"citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:899f8a7879feaecf9573ee64a29451db9c8bf33b3333517f1c821a396843b9f4","observation_id":"831a1e11-38ba-443b-8d03-a72fe0122d8c","resolution":{"observed_at":"2026-08-05T16:03:39.050426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-05T16:03:38.453321Z","title":"Pointer sentinel mixture models,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:38.453321Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:055a356e320a28fefe543fcc3c1e64193a784d0e840176699a5595cc85c84fb7","observation_id":"90c16b91-f1f3-4421-860f-f5104b84fcdd","resolution":{"observed_at":"2026-08-05T16:03:38.453321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T05:04:19.016659Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":1,"verified_fuzzy":49},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2508.19087."}