{"as_of":"2026-08-05T11:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:42bc44a572bd2d3788c34df8faf5d5524366749cc9fbec566f49fb16d80fd479","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T03:44:09.156934Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.09375/citation-record","integrity":"/paper/2605.09375/integrity","json":"/paper/2605.09375/citation-record.json","paper":"/paper/2605.09375"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2605.09375","last_updated":"2026-05-10T06:58:06Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T06:58:06Z","title":"31.1 A 14.08-to-135.69Token/s ReRAM-on-Logic Stacked Outlier-Free Large-Language-Model Accelerator with Block-Clustered Weight-Compression and Adaptive Parallel-Speculative-Decoding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T03:44:09.156934Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2605.09375"},"observation_digest":"sha256:01835526a50098cab3381ad6e6efefc7ad4b3078af359f34df0ac15d61297909","observation_id":"ad691436-92e0-4f5d-8e43-7fae2bf54446","resolution":{"observed_at":"2026-05-12T07:06:35.826799Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2605.09375","last_updated":"2026-05-10T06:58:06Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T06:58:06Z","title":"31.1 A 14.08-to-135.69Token/s ReRAM-on-Logic Stacked Outlier-Free Large-Language-Model Accelerator with Block-Clustered Weight-Compression and Adaptive Parallel-Speculative-Decoding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T03:44:09.156934Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2605.09375"},"observation_digest":"sha256:fbc77217574bbec7a48825d75016adaeb239e63b3aca41c8eb417c614ebcde08","observation_id":"21521193-4df6-4fbc-8560-64070aec0d63","resolution":{"observed_at":"2026-05-12T07:06:35.818712Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9657.2024","doi":"10.1109/isscc49657.2024","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: 2024 IEEE International Solid-State Circuits Conference (ISSCC)","venue":null,"work_id":"abcef84d-db7c-4667-88b0-155999d7df30","year":2024},"citing_paper":{"arxiv_id":"2605.09375","last_updated":"2026-05-10T06:58:06Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T06:58:06Z","title":"31.1 A 14.08-to-135.69Token/s ReRAM-on-Logic Stacked Outlier-Free Large-Language-Model Accelerator with Block-Clustered Weight-Compression and Adaptive Parallel-Speculative-Decoding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T03:44:09.156934Z"},"links":{"citing_paper":"/paper/2605.09375"},"observation_digest":"sha256:c7778b21ba676f50c9550f120473ffc7aa12836bcdba1c141e55e3ad2be8f4b1","observation_id":"fb0cda2b-1be5-4e89-b731-a780c5242b57","resolution":{"observed_at":"2026-05-12T03:46:21.266864Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9661.2025","doi":"10.1109/isscc49661.2025.10904499","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chen, Phil C","venue":null,"work_id":"9de564c5-30fe-462d-aafa-d398bfb0e0eb","year":2025},"citing_paper":{"arxiv_id":"2605.09375","last_updated":"2026-05-10T06:58:06Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T06:58:06Z","title":"31.1 A 14.08-to-135.69Token/s ReRAM-on-Logic Stacked Outlier-Free Large-Language-Model Accelerator with Block-Clustered Weight-Compression and Adaptive Parallel-Speculative-Decoding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T03:44:09.156934Z"},"links":{"citing_paper":"/paper/2605.09375"},"observation_digest":"sha256:cee88fbd9a07fd61a1416ca9cae4a679f237308f964fc585e72114400b228660","observation_id":"e89014a4-d505-45f6-9e0c-d6cc4a00faa8","resolution":{"observed_at":"2026-05-12T03:46:21.271836Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9661.2025","doi":"10.1109/isscc49661.2025.10904499","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chen, Phil C","venue":null,"work_id":"9de564c5-30fe-462d-aafa-d398bfb0e0eb","year":2025},"citing_paper":{"arxiv_id":"2605.09375","last_updated":"2026-05-10T06:58:06Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T06:58:06Z","title":"31.1 A 14.08-to-135.69Token/s ReRAM-on-Logic Stacked Outlier-Free Large-Language-Model Accelerator with Block-Clustered Weight-Compression and Adaptive Parallel-Speculative-Decoding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T03:44:09.156934Z"},"links":{"citing_paper":"/paper/2605.09375"},"observation_digest":"sha256:7666c392039616f2b00adeaa98f7e61a6e92aec7bf0335adc6980224bc6d922a","observation_id":"faa03761-8e7f-41b3-8142-7debcbe9a663","resolution":{"observed_at":"2026-05-12T03:46:21.261800Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5189.2025","doi":"10.23919/vlsitechnologyandcir65189.2025.11074854","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLM-CIM: A 28nm 126.7 TOPS/W Input-LUT-Based Digital CIM Macro with Reconﬁgurable Matrix Multiplication and Nonlinear Operation Modes for LLMs","venue":null,"work_id":"1b111967-80fb-4131-bd84-f71cb10e710f","year":2025},"citing_paper":{"arxiv_id":"2605.09375","last_updated":"2026-05-10T06:58:06Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T06:58:06Z","title":"31.1 A 14.08-to-135.69Token/s ReRAM-on-Logic Stacked Outlier-Free Large-Language-Model Accelerator with Block-Clustered Weight-Compression and Adaptive Parallel-Speculative-Decoding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T03:44:09.156934Z"},"links":{"citing_paper":"/paper/2605.09375"},"observation_digest":"sha256:2a1c20b7e4f6da566b61c37a80067219e29abd6bae26284404f811101fb12857","observation_id":"1d54404d-e0e4-4259-bdd5-427f82877c22","resolution":{"observed_at":"2026-05-12T03:46:21.248843Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5189.2025","doi":"10.23919/vlsitechnologyandcir65189.2025.11074854","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLM-CIM: A 28nm 126.7 TOPS/W Input-LUT-Based Digital CIM Macro with Reconﬁgurable Matrix Multiplication and Nonlinear Operation Modes for LLMs","venue":null,"work_id":"1b111967-80fb-4131-bd84-f71cb10e710f","year":2025},"citing_paper":{"arxiv_id":"2605.09375","last_updated":"2026-05-10T06:58:06Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T06:58:06Z","title":"31.1 A 14.08-to-135.69Token/s ReRAM-on-Logic Stacked Outlier-Free Large-Language-Model Accelerator with Block-Clustered Weight-Compression and Adaptive Parallel-Speculative-Decoding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T03:44:09.156934Z"},"links":{"citing_paper":"/paper/2605.09375"},"observation_digest":"sha256:5d1b8777efc66637237082466f9d18640aacfbd66e5c63440f0c05e116858360","observation_id":"b6b93be1-ae6c-40e3-b723-e0c4cb33192c","resolution":{"observed_at":"2026-05-12T03:46:21.240092Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.17192","last_updated":"2023-05-18T20:28:20Z","snapshot_observed_at":"2026-07-06T14:25:12.946406Z","submitted_at":"2022-11-30T17:33:28Z","title":"Fast Inference from Transformers via Speculative Decoding","version":2},"cited_work":{"arxiv_id":"2211.17192","doi":"10.48550/arxiv.2211.17192","metadata_source":"pith","pith_arxiv_id":"2211.17192","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fast Inference from Transformers via Speculative Decoding","venue":"cs.LG","work_id":"a17596db-fb15-4793-9ce6-fc620a92ae36","year":2022},"citing_paper":{"arxiv_id":"2605.09375","last_updated":"2026-05-10T06:58:06Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T06:58:06Z","title":"31.1 A 14.08-to-135.69Token/s ReRAM-on-Logic Stacked Outlier-Free Large-Language-Model Accelerator with Block-Clustered Weight-Compression and Adaptive Parallel-Speculative-Decoding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T03:44:09.156934Z"},"links":{"cited_paper":"/paper/2211.17192","citing_paper":"/paper/2605.09375"},"observation_digest":"sha256:7a23f6fdf2fb2f0bdfcb413293b0b658985b5b71054c47be7cef2701eb696faa","observation_id":"67108ed4-3724-4fef-b297-266b4c1e8cdb","resolution":{"observed_at":"2026-05-17T22:52:00.384886Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15077","last_updated":"2025-03-04T13:58:39Z","snapshot_observed_at":"2026-08-03T09:40:31.365295Z","submitted_at":"2024-01-26T18:59:01Z","title":"EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty","version":3},"cited_work":{"arxiv_id":"2401.15077","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.15077","snapshot_observed_at":"2026-07-10T21:57:38.979373Z","title":"EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty","venue":"cs.LG","work_id":"9d4637dd-1cab-4f10-82d4-8c8d14bb96ed","year":2024},"citing_paper":{"arxiv_id":"2605.09375","last_updated":"2026-05-10T06:58:06Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T06:58:06Z","title":"31.1 A 14.08-to-135.69Token/s ReRAM-on-Logic Stacked Outlier-Free Large-Language-Model Accelerator with Block-Clustered Weight-Compression and Adaptive Parallel-Speculative-Decoding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T03:44:09.156934Z"},"links":{"cited_paper":"/paper/2401.15077","citing_paper":"/paper/2605.09375"},"observation_digest":"sha256:c033cd712d81f2a23d5ed45fbe53e8768612be3746305ad70d31756859456dd5","observation_id":"8f48313d-678b-4deb-8be0-c6f05213344d","resolution":{"observed_at":"2026-05-15T00:15:49.524886Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-07-31T03:44:36.976336Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":"2210.17323","doi":"10.48550/arxiv.2210.17323","metadata_source":"pith","pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","venue":"cs.LG","work_id":"19ed8c44-202a-48f6-8169-637d5a5f2408","year":2022},"citing_paper":{"arxiv_id":"2605.09375","last_updated":"2026-05-10T06:58:06Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T06:58:06Z","title":"31.1 A 14.08-to-135.69Token/s ReRAM-on-Logic Stacked Outlier-Free Large-Language-Model Accelerator with Block-Clustered Weight-Compression and Adaptive Parallel-Speculative-Decoding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T03:44:09.156934Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2605.09375"},"observation_digest":"sha256:bf4caa230f20abe569f0758c609e7c215fa6984b2de2b8fcc8e2a91e76e46300","observation_id":"3bb9ab90-db7d-4073-b44c-f6e3879dd651","resolution":{"observed_at":"2026-05-12T07:06:35.728482Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-17T20:22:03.028003+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-17T20:22:03.028003+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00456","last_updated":"2024-10-29T11:09:12Z","snapshot_observed_at":"2026-08-05T10:45:45.389337Z","submitted_at":"2024-03-30T19:20:06Z","title":"QuaRot: Outlier-Free 4-Bit Inference in Rotated LLMs","version":2},"cited_work":{"arxiv_id":"2404.00456","doi":"10.48550/arxiv.2404.00456","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00456","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Croci, Bo Li, Martin Jaggi, Dan Alistarh, Torsten Hoefler, and James Hensman","venue":"arXiv (Cornell University)","work_id":"b0bace20-bbcd-45d2-99df-9bf26e089b47","year":2024},"citing_paper":{"arxiv_id":"2605.09375","last_updated":"2026-05-10T06:58:06Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T06:58:06Z","title":"31.1 A 14.08-to-135.69Token/s ReRAM-on-Logic Stacked Outlier-Free Large-Language-Model Accelerator with Block-Clustered Weight-Compression and Adaptive Parallel-Speculative-Decoding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T03:44:09.156934Z"},"links":{"cited_paper":"/paper/2404.00456","citing_paper":"/paper/2605.09375"},"observation_digest":"sha256:5143adfa4b64a3549f64f6eb86b706b294f053feab2501ac667b4a8c7dfd1083","observation_id":"12734c7c-0744-44f0-922e-c1f47028c63b","resolution":{"observed_at":"2026-05-12T07:06:35.739344Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16406","last_updated":"2025-02-20T06:07:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-26T02:15:49Z","title":"SpinQuant: LLM quantization with learned rotations","version":4},"cited_work":{"arxiv_id":"2405.16406","doi":"10.48550/arxiv.2405.16406","metadata_source":"pith","pith_arxiv_id":"2405.16406","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SpinQuant: LLM quantization with learned rotations","venue":"cs.LG","work_id":"489855f8-bd1c-4c87-a334-f6ab27d6707d","year":2024},"citing_paper":{"arxiv_id":"2605.09375","last_updated":"2026-05-10T06:58:06Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T06:58:06Z","title":"31.1 A 14.08-to-135.69Token/s ReRAM-on-Logic Stacked Outlier-Free Large-Language-Model Accelerator with Block-Clustered Weight-Compression and Adaptive Parallel-Speculative-Decoding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T03:44:09.156934Z"},"links":{"cited_paper":"/paper/2405.16406","citing_paper":"/paper/2605.09375"},"observation_digest":"sha256:f51b8575d797d3607a8c5fd60d491d5fb5f5880de8923e503188244c4cb2324c","observation_id":"d0a2d94d-27f0-4435-9a9c-d69c0481b990","resolution":{"observed_at":"2026-05-15T15:52:34.845430Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RoLoRA: Fine-tuning Rotated Outlier-free LLMs for Effective Weight- Activation Quantization","venue":null,"work_id":"3262631f-4964-4c69-90e2-053cb768e59a","year":null},"citing_paper":{"arxiv_id":"2605.09375","last_updated":"2026-05-10T06:58:06Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T06:58:06Z","title":"31.1 A 14.08-to-135.69Token/s ReRAM-on-Logic Stacked Outlier-Free Large-Language-Model Accelerator with Block-Clustered Weight-Compression and Adaptive Parallel-Speculative-Decoding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T03:44:09.156934Z"},"links":{"citing_paper":"/paper/2605.09375"},"observation_digest":"sha256:5f44075a8f9d88ed90f428d98ad170f3ede908769df2096ebc4b900ed62247e1","observation_id":"e6681262-e60b-4534-8ad5-a8144c0b6cae","resolution":{"observed_at":"2026-05-12T18:21:45.420857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:47:46.776388Z","title":"Knowledge-Centric Hallucination Detection","venue":null,"work_id":"557a574b-31bd-4f07-9bd0-47bc7c74bcd8","year":2024},"citing_paper":{"arxiv_id":"2605.09375","last_updated":"2026-05-10T06:58:06Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T06:58:06Z","title":"31.1 A 14.08-to-135.69Token/s ReRAM-on-Logic Stacked Outlier-Free Large-Language-Model Accelerator with Block-Clustered Weight-Compression and Adaptive Parallel-Speculative-Decoding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T03:44:09.156934Z"},"links":{"citing_paper":"/paper/2605.09375"},"observation_digest":"sha256:3ba4772b99771267423de6d3e4525dbeadea000518121256db9c5b2da2005682","observation_id":"424cd955-7580-4e79-ac30-f35a5dca4cb6","resolution":{"observed_at":"2026-05-12T03:46:21.251628Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:47.367793+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:47.367793+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11850","last_updated":"2025-02-17T03:33:50Z","snapshot_observed_at":"2026-07-06T19:04:13.760549Z","submitted_at":"2024-08-13T08:32:06Z","title":"PEARL: Parallel Speculative Decoding with Adaptive Draft Length","version":3},"cited_work":{"arxiv_id":"2408.11850","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.11850","snapshot_observed_at":"2026-07-03T10:27:57.130543Z","title":"Pearl: Parallel speculative decoding with adaptive draft length","venue":null,"work_id":"603a6f15-ccfd-459f-8cda-4cd168721ad7","year":2024},"citing_paper":{"arxiv_id":"2605.09375","last_updated":"2026-05-10T06:58:06Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T06:58:06Z","title":"31.1 A 14.08-to-135.69Token/s ReRAM-on-Logic Stacked Outlier-Free Large-Language-Model Accelerator with Block-Clustered Weight-Compression and Adaptive Parallel-Speculative-Decoding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T03:44:09.156934Z"},"links":{"cited_paper":"/paper/2408.11850","citing_paper":"/paper/2605.09375"},"observation_digest":"sha256:33c9fc413829f12a65aed17cdc51f9cab1509a8771666d26f7855ebd3a8b2509","observation_id":"b1cc9dbf-d093-449f-86da-9fecb5d035e4","resolution":{"observed_at":"2026-05-12T07:06:35.778873Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A Library of Hadamard Matrices","venue":null,"work_id":"7c0f8631-3887-4367-b1ee-f09d724a0771","year":2024},"citing_paper":{"arxiv_id":"2605.09375","last_updated":"2026-05-10T06:58:06Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T06:58:06Z","title":"31.1 A 14.08-to-135.69Token/s ReRAM-on-Logic Stacked Outlier-Free Large-Language-Model Accelerator with Block-Clustered Weight-Compression and Adaptive Parallel-Speculative-Decoding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T03:44:09.156934Z"},"links":{"citing_paper":"/paper/2605.09375"},"observation_digest":"sha256:f10fe8914738b82caa9588833fc4ea27393108a6091c3b82a4b5fa26c13f6647","observation_id":"589f52d5-9c73-4a11-a409-d9a274ea8539","resolution":{"observed_at":"2026-05-12T18:21:45.425633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15319","last_updated":"2025-06-03T09:22:07Z","snapshot_observed_at":"2026-07-06T17:34:32.617468Z","submitted_at":"2024-02-23T13:39:16Z","title":"GPTVQ: The Blessing of Dimensionality for LLM Quantization","version":2},"cited_work":{"arxiv_id":"2402.15319","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.15319","snapshot_observed_at":"2026-07-02T16:27:09.692691Z","title":"Gptvq: The blessing of dimensionality for llm quantization","venue":null,"work_id":"58ffc26d-9585-4dfe-9721-1983f0964b40","year":2024},"citing_paper":{"arxiv_id":"2605.09375","last_updated":"2026-05-10T06:58:06Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T06:58:06Z","title":"31.1 A 14.08-to-135.69Token/s ReRAM-on-Logic Stacked Outlier-Free Large-Language-Model Accelerator with Block-Clustered Weight-Compression and Adaptive Parallel-Speculative-Decoding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T03:44:09.156934Z"},"links":{"cited_paper":"/paper/2402.15319","citing_paper":"/paper/2605.09375"},"observation_digest":"sha256:7cf445e1b7c5defd6de44a752e575252216b694f10d50cf8a890f5a7cc993dcf","observation_id":"cffa07f2-e394-4c2c-b743-8eb9454b7f60","resolution":{"observed_at":"2026-05-12T07:06:35.747950Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.467","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VPTQ: Extreme Low-bit Vector Post-Training Quantization for Large Language Models","venue":null,"work_id":"87894e46-5f53-4c91-bc33-c55dfa3ef291","year":2024},"citing_paper":{"arxiv_id":"2605.09375","last_updated":"2026-05-10T06:58:06Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T06:58:06Z","title":"31.1 A 14.08-to-135.69Token/s ReRAM-on-Logic Stacked Outlier-Free Large-Language-Model Accelerator with Block-Clustered Weight-Compression and Adaptive Parallel-Speculative-Decoding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T03:44:09.156934Z"},"links":{"citing_paper":"/paper/2605.09375"},"observation_digest":"sha256:c223f84c73d55d9391e1ee3779af78969b0dec9af8ba425e6ee824ffd93a8a9e","observation_id":"1b511755-7aba-4676-894e-3b8fe2672e51","resolution":{"observed_at":"2026-05-12T03:46:21.244099Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10261","last_updated":"2024-12-16T08:54:43Z","snapshot_observed_at":"2026-07-06T20:06:39.463209Z","submitted_at":"2024-12-13T16:30:35Z","title":"MVQ:Towards Efficient DNN Compression and Acceleration with Masked Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.10261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10261","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MVQ: Towards Efﬁcient DNN Compression and Acceleration with Masked Vector Quantization","venue":null,"work_id":"adc27753-6f1e-4256-869b-d2de3878f458","year":2025},"citing_paper":{"arxiv_id":"2605.09375","last_updated":"2026-05-10T06:58:06Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T06:58:06Z","title":"31.1 A 14.08-to-135.69Token/s ReRAM-on-Logic Stacked Outlier-Free Large-Language-Model Accelerator with Block-Clustered Weight-Compression and Adaptive Parallel-Speculative-Decoding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T03:44:09.156934Z"},"links":{"cited_paper":"/paper/2412.10261","citing_paper":"/paper/2605.09375"},"observation_digest":"sha256:2a17fb1c949e5a0407df03572aec1227d542b7949ba95682eb9d95b351d09b94","observation_id":"0de6ade0-9d54-4cbb-a906-cdbddb5dc7fa","resolution":{"observed_at":"2026-05-12T07:06:35.697571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17481","last_updated":"2024-12-07T12:01:28Z","snapshot_observed_at":"2026-08-04T12:55:07.134932Z","submitted_at":"2024-09-26T02:37:41Z","title":"MaskLLM: Learnable Semi-Structured Sparsity for Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.17481","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.17481","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MaskLLM: Learnable Semi-Structured Sparsity for Large Language Models","venue":null,"work_id":"9e473519-dd16-4e3b-8a22-607a9721cc40","year":2024},"citing_paper":{"arxiv_id":"2605.09375","last_updated":"2026-05-10T06:58:06Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T06:58:06Z","title":"31.1 A 14.08-to-135.69Token/s ReRAM-on-Logic Stacked Outlier-Free Large-Language-Model Accelerator with Block-Clustered Weight-Compression and Adaptive Parallel-Speculative-Decoding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T03:44:09.156934Z"},"links":{"cited_paper":"/paper/2409.17481","citing_paper":"/paper/2605.09375"},"observation_digest":"sha256:dda99b118568226795a755c6cc90243b4913c6609302b249aaa4fdca8f6fe55c","observation_id":"59d974bf-9fd7-4ba9-8778-7713a9bf597e","resolution":{"observed_at":"2026-05-12T07:06:35.708278Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9661.2025","doi":"10.1109/isscc49661.2025.10904499","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chen, Phil C","venue":null,"work_id":"9de564c5-30fe-462d-aafa-d398bfb0e0eb","year":2025},"citing_paper":{"arxiv_id":"2605.09375","last_updated":"2026-05-10T06:58:06Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T06:58:06Z","title":"31.1 A 14.08-to-135.69Token/s ReRAM-on-Logic Stacked Outlier-Free Large-Language-Model Accelerator with Block-Clustered Weight-Compression and Adaptive Parallel-Speculative-Decoding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T03:44:09.156934Z"},"links":{"citing_paper":"/paper/2605.09375"},"observation_digest":"sha256:6bb319452311932c6b72c78e17f1d6bbea32feacd51272db37f1f46305e4cf23","observation_id":"e24bc3cb-5181-43bb-a55d-2cce71e61427","resolution":{"observed_at":"2026-05-12T03:46:21.235136Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3337.303770","doi":"10.1145/3093337.3037701","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kill the Program Counter: Reconstructing Program Behavior in the Processor Cache Hierarchy","venue":"ACM SIGARCH Computer Architecture News","work_id":"3b0f5f71-7878-433a-b284-83857d328f54","year":2017},"citing_paper":{"arxiv_id":"2605.09375","last_updated":"2026-05-10T06:58:06Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T06:58:06Z","title":"31.1 A 14.08-to-135.69Token/s ReRAM-on-Logic Stacked Outlier-Free Large-Language-Model Accelerator with Block-Clustered Weight-Compression and Adaptive Parallel-Speculative-Decoding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T03:44:09.156934Z"},"links":{"citing_paper":"/paper/2605.09375"},"observation_digest":"sha256:00f4e7a45c2f936c2492bad446d75128d148a8905140e7c94d2e2c9329ac3b64","observation_id":"4a5b26df-3d77-4de7-9a99-72617e9ea09a","resolution":{"observed_at":"2026-05-12T03:46:21.256864Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.09375","last_updated":"2026-05-10T06:58:06Z","latest_version":1,"primary_category":"cs.AR","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T06:58:06Z","title":"31.1 A 14.08-to-135.69Token/s ReRAM-on-Logic Stacked Outlier-Free Large-Language-Model Accelerator with Block-Clustered Weight-Compression and Adaptive Parallel-Speculative-Decoding"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":8,"parse_uncertain":0,"unresolved":0,"verified_exact":12,"verified_fuzzy":2},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2605.09375."}