{"as_of":"2026-08-08T11:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0ca8512e5e905712352c80728ab09b44171f935e3dbef3d89bd7149c04fc827c","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:14:34.248578Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.09010/citation-record","integrity":"/paper/2507.09010/integrity","json":"/paper/2507.09010/citation-record.json","paper":"/paper/2507.09010"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-06T18:14:30.679512Z","title":"Phi-3 technical report: A highly capable language model locally on your phone,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:30.679512Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:fbad3765eaae3b01337edb4f03e65ab57426e9ea6333bab5013eb75299a46768","observation_id":"125dcfd3-a8ce-415c-aff3-bf46e1c0c658","resolution":{"observed_at":"2026-08-06T18:14:30.679512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:37.820331Z","title":"Architecting an energy-efficient dram system for gpus,","venue":null,"work_id":"ad8636e0-3c10-430a-8945-dd2d121336de","year":2017},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:30.781016Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:7827e9bface3238f60e242d6cc9d19d1dbd8e647a64bbaebb449fcc08bdb0021","observation_id":"6a46ac35-ff27-42bf-88d0-41f738ec937c","resolution":{"observed_at":"2026-08-06T18:14:37.886190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9329.36559","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:34.675752Z","title":"Sparc: Token similarity-aware sparse attention transformer accelerator via row- wise clustering,","venue":null,"work_id":"ce532f18-d84d-4384-a5b6-d4385e71c29f","year":2024},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:30.882849Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:515d4cf3dd66e0034058129dfc8d2274731f834a9cd16397ace08d7565adae98","observation_id":"a25e08c6-6864-44fe-a9c9-88abd2013d9d","resolution":{"observed_at":"2026-08-06T18:14:34.814240Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:37.638358Z","title":"Vs-quant: Per-vector scaled quantization for accurate low-precision neural network inference,","venue":null,"work_id":"9eca96a5-b466-4db8-9ca9-7477276038e5","year":2021},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:30.998677Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:d9f9f66229119f11255153e94cd3a14091521f72229801ded87e626615f3cfec","observation_id":"34755e6b-31d8-4b32-94d9-815620da707c","resolution":{"observed_at":"2026-08-06T18:14:37.732439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:37.417175Z","title":"Transformers are ssms: generalized models and efficient algorithms through structured state space duality,","venue":null,"work_id":"1226c8f5-799e-4a3c-a008-9f69a31d4fa3","year":2024},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:31.160451Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:c1e983a0aff18e1c6346de8ef153b5fb7d4f589cb420a4b66273ddd0a1540bef","observation_id":"3a0cdbe1-cfcc-48f5-b0d1-54c28458854c","resolution":{"observed_at":"2026-08-06T18:14:37.500968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T18:14:31.335666Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:31.335666Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:50d30f543dc1fba5643323a62611504e1fc9bc96f6a69537abf868ac6179b32b","observation_id":"66c0df4d-6f78-4f89-ba81-79b91d88541e","resolution":{"observed_at":"2026-08-06T18:14:31.335666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T08:38:54.025062Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-06T18:14:31.524697Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:31.524697Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:aa16a656d58d2f5c43cfd99ce307269e313f0c2817fc54e4fa0cb32abd31d836","observation_id":"3784dc49-c9c0-4a86-8470-cbfb4a3b2835","resolution":{"observed_at":"2026-08-06T18:14:31.524697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:37.138579Z","title":"Ita: An energy-efficient attention and softmax accelerator for quantized transformers,","venue":null,"work_id":"ab998e46-ff88-4612-acb9-050fcf85ae9c","year":2023},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:31.678953Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:63a86d483c092e8e6aed1bac5f60fa7156762d8b8fc474962f82a380dd5eabe7","observation_id":"d8bc71ae-75fa-4932-9ac9-b44e22b27322","resolution":{"observed_at":"2026-08-06T18:14:37.287077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:36.939296Z","title":"A 95.6-tops/w deep learning inference accelerator with per-vector scaled 4-bit quantization in 5 nm,","venue":null,"work_id":"6603a3b0-f1c6-4dcf-bc5e-4f1d1ff36a01","year":2023},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:31.808138Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:85c9eaf524f9fe32d6b082b0270fb66e963aa05febc9687c10620d03795cdeac","observation_id":"6ae7e611-7543-4731-9974-a386988a59ee","resolution":{"observed_at":"2026-08-06T18:14:37.034304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:36.780414Z","title":"A modular digital vlsi flow for high-productivity soc design,","venue":null,"work_id":"97ff0c41-73a8-421c-9243-21f5bdf170bf","year":2018},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:31.943718Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:6990a4edc7f9915e1a6aa19f8e2664a9f7d9b66132bcc1848a2f1e96ea9ee310","observation_id":"fdb2cc5d-6404-4b53-92de-dc385ed4ba1b","resolution":{"observed_at":"2026-08-06T18:14:36.873081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:36.577879Z","title":null,"venue":null,"work_id":"713ff3e0-4d2c-4500-bd7f-9aedb8dfe981","year":2024},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:32.130864Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:b6bc47bfe5a1dd27e8fd79df506ded316d94fc814934ff648f1b5bae60f4032d","observation_id":"b8d9e08d-f57f-4dab-931e-5d180b80849e","resolution":{"observed_at":"2026-08-06T18:14:36.700328Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04532","last_updated":"2025-05-01T02:14:05Z","snapshot_observed_at":"2026-08-08T04:42:16.973896Z","submitted_at":"2024-05-07T17:59:30Z","title":"QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04532","snapshot_observed_at":"2026-08-06T18:14:32.263418Z","title":"Qserve: W4a8kv4 quantization and system co-design for efficient llm serving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:32.263418Z"},"links":{"cited_paper":"/paper/2405.04532","citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:81d5b0d53a02643b76c4beba973a674f1f63fffa51c1f5949d5bb499644de603","observation_id":"0387f486-e94f-49c8-8ebe-fc057f5bc4cd","resolution":{"observed_at":"2026-08-06T18:14:32.263418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:36.437772Z","title":"Bucket getter: A bucket-based processing engine for low-bit block floating point (bfp) dnns,","venue":null,"work_id":"00c61728-8156-40a7-a8e5-29c237d2e560","year":2023},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:32.395489Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:c525b6a76c7514d6c04fb6abbe22cb50b59ecd9b3e9dbe2e13154e0f05216b93","observation_id":"def74e63-7de3-44bf-a8cb-f29f4cb1ce2f","resolution":{"observed_at":"2026-08-06T18:14:36.503663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:32.553413Z","title":"Pointer sentinel mixture models,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:32.553413Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:441bc37c95ce08100b584e5d60d97984214d79a8f721dd9af67d6937e0ad76d3","observation_id":"16c20b43-0be1-4b68-9fb2-77ac679ae042","resolution":{"observed_at":"2026-08-06T18:14:32.553413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:36.287362Z","title":"A 127.8 tops/w arbitrarily quantized 1-to-8b scalable-precision accelerator for general-purpose deep learning with reduction of storage, logic and latency waste,","venue":null,"work_id":"2bbe58e7-9ba8-4880-91a7-35657ea24f83","year":2023},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:32.750560Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:8277bb192db0f58a92848699a60222f095faecef77bfecc737e02f6e353d1be4","observation_id":"81e4aa70-d83f-4540-996b-5287005ee479","resolution":{"observed_at":"2026-08-06T18:14:36.352125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.06023","last_updated":"2016-08-26T16:13:13Z","snapshot_observed_at":"2026-07-30T19:30:50.474373Z","submitted_at":"2016-02-19T02:04:18Z","title":"Abstractive Text Summarization Using Sequence-to-Sequence RNNs and Beyond","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.06023","snapshot_observed_at":"2026-08-06T18:14:32.895076Z","title":"Abstractive text summarization using sequence-to-sequence rnns and beyond,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:32.895076Z"},"links":{"cited_paper":"/paper/1602.06023","citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:10de2011971aa06e6d9c32f97299ae0b5450449ccf6bcd3b60c77fbf113bde3a","observation_id":"68ca6f1a-0c32-4cd3-aa27-8741e8d6070b","resolution":{"observed_at":"2026-08-06T18:14:32.895076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:36.098019Z","title":"Nvidia jetson orin nano,","venue":null,"work_id":"725db7bc-d7ed-45a6-99c5-13ac634ec3b1","year":2024},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:33.022172Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:10d25a4e7737e8491fb09d91623c9e965f620fa40a774fcc70ac63bbfc84c613","observation_id":"defed1f5-5f58-4e28-b12b-ed08d7d6e9d7","resolution":{"observed_at":"2026-08-06T18:14:36.207990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:35.877896Z","title":"Fine-grained dram: Energy-efficient dram for extreme bandwidth systems,","venue":null,"work_id":"4ee79755-79e6-42d7-8c30-518e2223b4cb","year":2017},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:33.116701Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:9f0c58a622ae6775a0ccc53ebcfd5a17e1ae3492a1623f0ee5afdc23c25c6345","observation_id":"70b8b192-fcd8-4095-a1ae-e25967db41e1","resolution":{"observed_at":"2026-08-06T18:14:35.961479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:35.716339Z","title":"Fact: Ffn-attention co-optimized transformer architecture with eager correlation prediction,","venue":null,"work_id":"e2b9f61e-1f73-4c10-9af5-6e37229e3e3b","year":2023},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:33.205827Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:0d7423fb022b23aca9c8c1a3cbfd43869ee651b39261da2fb9c669a5badf2c41","observation_id":"20372408-fd1a-45c2-a80b-55319903ab74","resolution":{"observed_at":"2026-08-06T18:14:35.792388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:35.537758Z","title":"Mecla: Memory-compute-efficient llm accelerator with scaling sub-matrix partition,","venue":null,"work_id":"2e07d6c8-0649-47da-b1dd-bbcd5bc81d1e","year":2024},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:33.352616Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:ffeed31da8529fbf72f124bcb0f5d017435ea9eaad32a8249773d12aa6debc00","observation_id":"94c2d3bf-c2c2-4fa2-bfb2-d7bc4e72f9ce","resolution":{"observed_at":"2026-08-06T18:14:35.605872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-08-08T01:04:32.134805Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-08-06T18:14:33.447407Z","title":"Microscaling data formats for deep learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:33.447407Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:5f1d3777a7488e0e77dcde072eb5d2d7166a284d347fac7b31089abc915bf23a","observation_id":"260f865f-bf22-41ba-941c-9f2c8516265b","resolution":{"observed_at":"2026-08-06T18:14:33.447407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:33.587252Z","title":"Roformer: En- hanced transformer with rotary position embedding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:33.587252Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:a44419ffc59d0185b58760be833fe66b478d06e5490b01d4d87fdff1b0bf6b58","observation_id":"9bc362b9-8a4e-4af1-ba6e-438221315542","resolution":{"observed_at":"2026-08-06T18:14:33.587252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-06T18:14:33.692647Z","title":"Retentive network: A successor to transformer for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:33.692647Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:48071cecf7d7b71062fd8e76f78bcd574bb5fa7c5bf5e56ae686ddd1f75f5112","observation_id":"07c632fd-f886-4442-81de-7ebd830008e7","resolution":{"observed_at":"2026-08-06T18:14:33.692647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T18:14:33.762234Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:33.762234Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:761fa54b0aa103f552d3baede473f30e5c675b24e9525b2ce54269e6b77154dc","observation_id":"ffd7964c-373e-45db-95dc-293c43766d5f","resolution":{"observed_at":"2026-08-06T18:14:33.762234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:35.318529Z","title":"Sole: Hardware-software co-design of softmax and layernorm for efficient transformer inference,","venue":null,"work_id":"ebdca7ee-6b4c-4683-8ffb-9d1f95b3f059","year":2023},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:33.859677Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:a64f67f28d9894e2a645eb29fd354aee31ecdfbeeed31eb92f73976edb76f972","observation_id":"44f1cfe7-9c9c-4ac1-b62e-a6cc49823000","resolution":{"observed_at":"2026-08-06T18:14:35.383466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:33.974593Z","title":"Smoothquant: Accurate and efficient post-training quantization for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:33.974593Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:6b431741c8f8bfd60bdb0301f4514194d9daf8acec7408a73f0559dea2a71645","observation_id":"2079e212-5704-4a29-b94c-6110d504a9e2","resolution":{"observed_at":"2026-08-06T18:14:33.974593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:35.107237Z","title":"Llmcompass: Enabling efficient hardware design for large language model inference,","venue":null,"work_id":"f7cd361c-b45b-492a-9a78-51276d8b1f2f","year":2024},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:34.118676Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:9637b0f150b02fe0b0608adb6f6b7ac4a865dce5aee44fd71fa8caab61bc8a15","observation_id":"fb639e50-da2a-4437-85b3-05ef8531e8da","resolution":{"observed_at":"2026-08-06T18:14:35.216617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:34.894428Z","title":"Atom: Low-bit quantization for efficient and accurate llm serving,","venue":null,"work_id":"359aec27-8eb6-4893-a166-1a1a8794f103","year":2024},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:34.248578Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:a32c5168cf2f7c3bd40cf84892d788c9c421a29c8b8bd79713f47c05befc6caa","observation_id":"be55cd61-3724-4471-a10a-d6df02d4d13d","resolution":{"observed_at":"2026-08-06T18:14:35.002544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","latest_version":1,"primary_category":"cs.AR","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2507.09010."}