{"as_of":"2026-08-19T18:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:47af07cb5d15d49b0f96b2b8dee60ffd5eba753c837e788f1402e1d4539922a8","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:12:12.027472Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-09T19:06:18.309062Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T09:51:27.298033Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.16266","last_updated":"2025-04-24T18:14:11Z","snapshot_observed_at":"2026-08-18T18:17:54.516268Z","submitted_at":"2025-04-22T21:00:58Z","title":"TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs","version":2},"cited_work":{"arxiv_id":"2504.16266","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16266","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TeLLMe: An energy-efficient ternary LLM accelerator for prefill and decode on edge FPGAs","venue":null,"work_id":"fd985ccb-6cea-4110-8c56-c740bbb9d2f2","year":2025},"citing_paper":{"arxiv_id":"2604.25183","last_updated":"2026-04-28T03:42:53Z","snapshot_observed_at":"2026-08-14T23:30:23.883864Z","submitted_at":"2026-04-28T03:42:53Z","title":"Hardware Generation and Exploration of Lookup Table-Based Accelerators for 1.58-bit LLM Inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-07T14:52:39.193613Z"},"links":{"cited_paper":"/paper/2504.16266","citing_paper":"/paper/2604.25183"},"observation_digest":"sha256:1282d90041fe0df91d558152437bceb813169ed3236edf129fd6a5de2f9e3304","observation_id":"25a31676-9d8a-4a98-9fc2-7959df4fee3f","resolution":{"observed_at":"2026-05-12T00:41:16.416573Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16266","last_updated":"2025-04-24T18:14:11Z","snapshot_observed_at":"2026-08-18T18:17:54.516268Z","submitted_at":"2025-04-22T21:00:58Z","title":"TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs","version":2},"cited_work":{"arxiv_id":"2504.16266","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16266","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TeLLMe: An energy-efficient ternary LLM accelerator for prefill and decode on edge FPGAs","venue":null,"work_id":"fd985ccb-6cea-4110-8c56-c740bbb9d2f2","year":2025},"citing_paper":{"arxiv_id":"2604.27396","last_updated":"2026-04-30T04:07:21Z","snapshot_observed_at":"2026-08-14T23:31:51.746694Z","submitted_at":"2026-04-30T04:07:21Z","title":"VitaLLM: A Versatile, Ultra-Compact Ternary LLM Accelerator with Dependency-Aware Scheduling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-07T09:05:12.937377Z"},"links":{"cited_paper":"/paper/2504.16266","citing_paper":"/paper/2604.27396"},"observation_digest":"sha256:f37c9db8b00cdd049457d78feb4befdbd150712f60a46ee714433a9f823559f1","observation_id":"4147db7f-5dd0-4e91-8774-6ffb86da20e3","resolution":{"observed_at":"2026-05-12T09:51:27.301632Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16266","last_updated":"2025-04-24T18:14:11Z","snapshot_observed_at":"2026-08-18T18:17:54.516268Z","submitted_at":"2025-04-22T21:00:58Z","title":"TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs","version":2},"cited_work":{"arxiv_id":"2504.16266","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16266","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TeLLMe: An energy-efficient ternary LLM accelerator for prefill and decode on edge FPGAs","venue":null,"work_id":"fd985ccb-6cea-4110-8c56-c740bbb9d2f2","year":2025},"citing_paper":{"arxiv_id":"2605.00320","last_updated":"2026-05-01T00:59:46Z","snapshot_observed_at":"2026-08-18T08:56:08.380479Z","submitted_at":"2026-05-01T00:59:46Z","title":"VitaLLM: A Versatile and Tiny Accelerator for Mixed-Precision LLM Inference on Edge Devices","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-09T19:06:18.309062Z"},"links":{"cited_paper":"/paper/2504.16266","citing_paper":"/paper/2605.00320"},"observation_digest":"sha256:c998387307dda4784cc27b073fa55af2da3ded64262cbc34068921b787ba35f1","observation_id":"a88e72cc-2c61-412c-afb2-98c499eb21ff","resolution":{"observed_at":"2026-05-11T15:51:43.970023Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.16266/citation-record","integrity":"/paper/2504.16266/integrity","json":"/paper/2504.16266/citation-record.json","paper":"/paper/2504.16266"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:12:11.908072Z","title":"Language mod- els are few-shot learners,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2504.16266","last_updated":"2025-04-24T18:14:11Z","snapshot_observed_at":"2026-08-18T18:17:54.516268Z","submitted_at":"2025-04-22T21:00:58Z","title":"TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:12:11.908072Z"},"links":{"citing_paper":"/paper/2504.16266"},"observation_digest":"sha256:7361937fffe6d3de5924ba939b0306a6562b472458e589afcc31faffaeb9548a","observation_id":"1fcbbf87-326d-41a0-a155-010f9b692f0f","resolution":{"observed_at":"2026-08-16T11:12:11.908072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-16T11:12:11.913879Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16266","last_updated":"2025-04-24T18:14:11Z","snapshot_observed_at":"2026-08-18T18:17:54.516268Z","submitted_at":"2025-04-22T21:00:58Z","title":"TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:12:11.913879Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2504.16266"},"observation_digest":"sha256:07aa63d34964882d7637ee4fbebd88c11870ff8a0371f63a6c73a496ce7832d7","observation_id":"4ebdf683-005e-40c3-af8a-cde5f9a07130","resolution":{"observed_at":"2026-08-16T11:12:11.913879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:12:12.375199Z","title":"A two-stage efficient 3- d cnn framework for eeg based emotion recognition,","venue":null,"work_id":"14dfb804-d53f-4316-8712-9b5a040fe6e9","year":2022},"citing_paper":{"arxiv_id":"2504.16266","last_updated":"2025-04-24T18:14:11Z","snapshot_observed_at":"2026-08-18T18:17:54.516268Z","submitted_at":"2025-04-22T21:00:58Z","title":"TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:12:11.923677Z"},"links":{"citing_paper":"/paper/2504.16266"},"observation_digest":"sha256:366d821b0c59682923df9d309ebfe8225784669b63899960d6289fb94f33fd6e","observation_id":"69ef7ba5-e2b5-490a-b9f9-04e8a0bfad9f","resolution":{"observed_at":"2026-08-16T11:12:12.380073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:12:12.360796Z","title":"Bnn an ideal architecture for acceleration with resistive in memory computation,","venue":null,"work_id":"835a9880-3e24-4207-bd89-97a417c84bb2","year":2023},"citing_paper":{"arxiv_id":"2504.16266","last_updated":"2025-04-24T18:14:11Z","snapshot_observed_at":"2026-08-18T18:17:54.516268Z","submitted_at":"2025-04-22T21:00:58Z","title":"TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:12:11.929770Z"},"links":{"citing_paper":"/paper/2504.16266"},"observation_digest":"sha256:123d66cbe5eceff254aec13a7ca9b1b375b5ddeba0449ae60a4dff9b778fc7f6","observation_id":"a2a2012a-e994-4d55-9375-f73dc497e20e","resolution":{"observed_at":"2026-08-16T11:12:12.365582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-15T04:43:14.762539Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-16T11:12:11.934753Z","title":"Bitnet: Scaling 1-bit transformers for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16266","last_updated":"2025-04-24T18:14:11Z","snapshot_observed_at":"2026-08-18T18:17:54.516268Z","submitted_at":"2025-04-22T21:00:58Z","title":"TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:12:11.934753Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2504.16266"},"observation_digest":"sha256:fa52a3f3514ae59a891a5505ff5cc5c2932075dde0be65256c5f6bba9cee2acc","observation_id":"8896b396-eb9d-40f4-ab90-eee97880ee23","resolution":{"observed_at":"2026-08-16T11:12:11.934753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17764","last_updated":"2024-02-27T18:56:19Z","snapshot_observed_at":"2026-08-14T15:17:37.878305Z","submitted_at":"2024-02-27T18:56:19Z","title":"The Era of 1-bit LLMs: All Large Language Models are in 1.58 Bits","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17764","snapshot_observed_at":"2026-08-16T11:12:11.940413Z","title":"The era of 1-bit llms: All large language models are in 1.58 bits,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16266","last_updated":"2025-04-24T18:14:11Z","snapshot_observed_at":"2026-08-18T18:17:54.516268Z","submitted_at":"2025-04-22T21:00:58Z","title":"TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:12:11.940413Z"},"links":{"cited_paper":"/paper/2402.17764","citing_paper":"/paper/2504.16266"},"observation_digest":"sha256:7207a355c65c3312b0bf21a33416227ce229899d6a3b6e248f676effd07555c4","observation_id":"375ec7aa-e3d7-44ec-aa3d-6754f01c8611","resolution":{"observed_at":"2026-08-16T11:12:11.940413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-16T11:12:11.946205Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16266","last_updated":"2025-04-24T18:14:11Z","snapshot_observed_at":"2026-08-18T18:17:54.516268Z","submitted_at":"2025-04-22T21:00:58Z","title":"TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:12:11.946205Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2504.16266"},"observation_digest":"sha256:4acde19be9232f229a5f7cd8e763946f86a827dc114d1e03288153f2ab29269a","observation_id":"19a237eb-9dcc-4556-9c49-d8189e269fc3","resolution":{"observed_at":"2026-08-16T11:12:11.946205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10659","last_updated":"2025-02-15T03:56:22Z","snapshot_observed_at":"2026-08-16T12:58:12.624940Z","submitted_at":"2025-02-15T03:56:22Z","title":"Pushing up to the Limit of Memory Bandwidth and Capacity Utilization for Efficient LLM Decoding on Embedded FPGA","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10659","snapshot_observed_at":"2026-08-16T11:12:11.951884Z","title":"Pushing up to the limit of memory bandwidth and capacity utilization for efficient llm decoding on embedded fpga,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16266","last_updated":"2025-04-24T18:14:11Z","snapshot_observed_at":"2026-08-18T18:17:54.516268Z","submitted_at":"2025-04-22T21:00:58Z","title":"TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:12:11.951884Z"},"links":{"cited_paper":"/paper/2502.10659","citing_paper":"/paper/2504.16266"},"observation_digest":"sha256:d3cc96b4180286f71fc4969b94df600bd09c0ab7185c7d2ab9c5fe161765ac2a","observation_id":"91c1d3e8-5fa9-4a56-be39-1dcd4d8c27de","resolution":{"observed_at":"2026-08-16T11:12:11.951884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:12:12.342842Z","title":"Understanding the potential of fpga-based spatial accel- eration for large language model inference,","venue":null,"work_id":"34c49ac8-9900-44f6-8c46-021208a3f053","year":2024},"citing_paper":{"arxiv_id":"2504.16266","last_updated":"2025-04-24T18:14:11Z","snapshot_observed_at":"2026-08-18T18:17:54.516268Z","submitted_at":"2025-04-22T21:00:58Z","title":"TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:12:11.958490Z"},"links":{"citing_paper":"/paper/2504.16266"},"observation_digest":"sha256:88140f96c5e13aeb5d36beb91add396adfb4d048e2836f04a74c30263aa88bd4","observation_id":"6c96c758-2c2a-4018-abe1-1d902c3be773","resolution":{"observed_at":"2026-08-16T11:12:12.349465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07093","last_updated":"2024-07-09T17:59:48Z","snapshot_observed_at":"2026-08-16T13:35:40.532101Z","submitted_at":"2024-07-09T17:59:48Z","title":"FBI-LLM: Scaling Up Fully Binarized LLMs from Scratch via Autoregressive Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07093","snapshot_observed_at":"2026-08-16T11:12:11.965727Z","title":"Fbi-llm: Scaling up fully bina- rized llms from scratch via autoregressive distillation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16266","last_updated":"2025-04-24T18:14:11Z","snapshot_observed_at":"2026-08-18T18:17:54.516268Z","submitted_at":"2025-04-22T21:00:58Z","title":"TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:12:11.965727Z"},"links":{"cited_paper":"/paper/2407.07093","citing_paper":"/paper/2504.16266"},"observation_digest":"sha256:e5efe9aa6741707ed569d1b98b0500dd341a021ba7ddc3a2fca7d2416e7d56e5","observation_id":"2a75ffbf-02db-4237-a577-2c3f7ce488c0","resolution":{"observed_at":"2026-08-16T11:12:11.965727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:12:12.326548Z","title":"Onebit: Towards extremely low-bit large language models,","venue":null,"work_id":"81cf52b0-9e1b-43b5-875f-2497ee86a76c","year":2024},"citing_paper":{"arxiv_id":"2504.16266","last_updated":"2025-04-24T18:14:11Z","snapshot_observed_at":"2026-08-18T18:17:54.516268Z","submitted_at":"2025-04-22T21:00:58Z","title":"TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:12:11.973937Z"},"links":{"citing_paper":"/paper/2504.16266"},"observation_digest":"sha256:8b6cbfe3d9f7ed28808a6d017be3068664ad79536cf5f5b48f0f8f232c9238d2","observation_id":"cd4a10aa-f0c7-42e6-9ac9-42a86e4a5f9d","resolution":{"observed_at":"2026-08-16T11:12:12.331178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:12:12.311231Z","title":"Bitdistiller: Unleashing the potential of sub-4-bit llms via self-distillation,","venue":null,"work_id":"adc1cf48-922c-4c06-83f1-a617c87035f3","year":2024},"citing_paper":{"arxiv_id":"2504.16266","last_updated":"2025-04-24T18:14:11Z","snapshot_observed_at":"2026-08-18T18:17:54.516268Z","submitted_at":"2025-04-22T21:00:58Z","title":"TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:12:11.980320Z"},"links":{"citing_paper":"/paper/2504.16266"},"observation_digest":"sha256:75f308db4d93cdd788d56cc5a2e345f6c844a3fb8acf26e593fc9b049e591cc1","observation_id":"f1a51205-de58-4d2c-903d-30a5735ac138","resolution":{"observed_at":"2026-08-16T11:12:12.316137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13304","last_updated":"2024-01-15T21:54:28Z","snapshot_observed_at":"2026-08-18T08:36:45.091453Z","submitted_at":"2023-07-25T07:44:06Z","title":"QuIP: 2-Bit Quantization of Large Language Models With Guarantees","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13304","snapshot_observed_at":"2026-08-16T11:12:11.986624Z","title":"Quip: 2-bit quan- tization of large language models with guarantees,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16266","last_updated":"2025-04-24T18:14:11Z","snapshot_observed_at":"2026-08-18T18:17:54.516268Z","submitted_at":"2025-04-22T21:00:58Z","title":"TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:12:11.986624Z"},"links":{"cited_paper":"/paper/2307.13304","citing_paper":"/paper/2504.16266"},"observation_digest":"sha256:bb9b50c005ba754be3b777c2b46d6b3c513bd5cf24cd8c2d5ca457de41c0515f","observation_id":"7372115b-f171-4c0d-8498-72f0b1546050","resolution":{"observed_at":"2026-08-16T11:12:11.986624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00088","last_updated":"2025-03-25T09:27:16Z","snapshot_observed_at":"2026-08-18T23:34:27.005573Z","submitted_at":"2024-06-25T08:38:38Z","title":"T-MAC: CPU Renaissance via Table Lookup for Low-Bit LLM Deployment on Edge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00088","snapshot_observed_at":"2026-08-16T11:12:11.993156Z","title":"T-mac: Cpu renaissance via table lookup for low-bit llm deployment on edge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16266","last_updated":"2025-04-24T18:14:11Z","snapshot_observed_at":"2026-08-18T18:17:54.516268Z","submitted_at":"2025-04-22T21:00:58Z","title":"TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:12:11.993156Z"},"links":{"cited_paper":"/paper/2407.00088","citing_paper":"/paper/2504.16266"},"observation_digest":"sha256:2d0e75a45379d8a88c196a475a1120187116729d9e977ce025544b2b5147190c","observation_id":"8e73ae95-50dc-49d5-a921-098bde8fe1d5","resolution":{"observed_at":"2026-08-16T11:12:11.993156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11424","last_updated":"2024-09-12T17:53:37Z","snapshot_observed_at":"2026-08-19T17:35:48.507487Z","submitted_at":"2024-09-12T17:53:37Z","title":"LlamaF: An Efficient Llama2 Architecture Accelerator on Embedded FPGAs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11424","snapshot_observed_at":"2026-08-16T11:12:11.998609Z","title":"Llamaf: An efficient llama2 architecture accelerator on embedded fpgas,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16266","last_updated":"2025-04-24T18:14:11Z","snapshot_observed_at":"2026-08-18T18:17:54.516268Z","submitted_at":"2025-04-22T21:00:58Z","title":"TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:12:11.998609Z"},"links":{"cited_paper":"/paper/2409.11424","citing_paper":"/paper/2504.16266"},"observation_digest":"sha256:2a878464d4b1dd6abaf4816ee3fc00e19a1dd492ac7fbc7fa1f68a5886829c6a","observation_id":"21b859ee-1452-4092-b33f-dd7da05fb8af","resolution":{"observed_at":"2026-08-16T11:12:11.998609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:12:12.296047Z","title":"Edge-moe: Memory- efficient multi-task vision transformer architecture with task-level spar- sity via mixture-of-experts,","venue":null,"work_id":"363e9888-2b41-4ffd-8379-5b286eefedc9","year":2023},"citing_paper":{"arxiv_id":"2504.16266","last_updated":"2025-04-24T18:14:11Z","snapshot_observed_at":"2026-08-18T18:17:54.516268Z","submitted_at":"2025-04-22T21:00:58Z","title":"TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:12:12.003606Z"},"links":{"citing_paper":"/paper/2504.16266"},"observation_digest":"sha256:8c1b159f9c170245c25993132007c79ded293f94de7f321a3738a80b1849b7c9","observation_id":"207f4096-854e-461c-9d39-3a55e4146da4","resolution":{"observed_at":"2026-08-16T11:12:12.301205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00462","last_updated":"2024-08-01T11:06:05Z","snapshot_observed_at":"2026-08-16T13:29:16.107061Z","submitted_at":"2024-08-01T11:06:05Z","title":"Designing Efficient LLM Accelerators for Edge Devices","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00462","snapshot_observed_at":"2026-08-16T11:12:12.008702Z","title":"Designing efficient llm accelerators for edge devices,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16266","last_updated":"2025-04-24T18:14:11Z","snapshot_observed_at":"2026-08-18T18:17:54.516268Z","submitted_at":"2025-04-22T21:00:58Z","title":"TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:12:12.008702Z"},"links":{"cited_paper":"/paper/2408.00462","citing_paper":"/paper/2504.16266"},"observation_digest":"sha256:b402960df524726d1d8a795b311d4a2725e114f872e6b535533fa27edf2ff590","observation_id":"52dd96e2-493e-4779-80e4-ea56fe257e59","resolution":{"observed_at":"2026-08-16T11:12:12.008702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:12:12.278484Z","title":"Table- lookup mac: Scalable processing of quantised neural networks in fpga soft logic,","venue":null,"work_id":"dbdeba16-cfbd-47e7-9e09-9c25841d8928","year":2024},"citing_paper":{"arxiv_id":"2504.16266","last_updated":"2025-04-24T18:14:11Z","snapshot_observed_at":"2026-08-18T18:17:54.516268Z","submitted_at":"2025-04-22T21:00:58Z","title":"TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:12:12.014685Z"},"links":{"citing_paper":"/paper/2504.16266"},"observation_digest":"sha256:e534935872b8bf7ad3d068520dbccd1e474dc42ff97a16366232b59ef5a9a047","observation_id":"75c503f5-bf81-47c9-8e08-9e2ffa8ce75a","resolution":{"observed_at":"2026-08-16T11:12:12.284325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:12:12.260926Z","title":"Uram storage bind,","venue":null,"work_id":"ff40caab-61ff-4064-b5d6-bb4d565c121a","year":2024},"citing_paper":{"arxiv_id":"2504.16266","last_updated":"2025-04-24T18:14:11Z","snapshot_observed_at":"2026-08-18T18:17:54.516268Z","submitted_at":"2025-04-22T21:00:58Z","title":"TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:12:12.021281Z"},"links":{"citing_paper":"/paper/2504.16266"},"observation_digest":"sha256:e30a44e08651c876c179aa751d5f5012b2115fe9257f17a670425422170a6561","observation_id":"7f52e666-9468-441c-a13b-dcf0676ed204","resolution":{"observed_at":"2026-08-16T11:12:12.267221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14135","last_updated":"2022-06-23T17:53:32Z","snapshot_observed_at":"2026-07-06T13:14:48.753329Z","submitted_at":"2022-05-27T17:53:09Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14135","snapshot_observed_at":"2026-08-16T11:12:12.027472Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16266","last_updated":"2025-04-24T18:14:11Z","snapshot_observed_at":"2026-08-18T18:17:54.516268Z","submitted_at":"2025-04-22T21:00:58Z","title":"TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:12:12.027472Z"},"links":{"cited_paper":"/paper/2205.14135","citing_paper":"/paper/2504.16266"},"observation_digest":"sha256:a51333a320350e0f3e97d6b51c89dca6fc2e9462125409574035a1c3009bd05c","observation_id":"55ab18f8-1cef-4b15-b077-5dc3fe978f8f","resolution":{"observed_at":"2026-08-16T11:12:12.027472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.16266","last_updated":"2025-04-24T18:14:11Z","latest_version":2,"primary_category":"cs.AR","snapshot_observed_at":"2026-08-18T18:17:54.516268Z","submitted_at":"2025-04-22T21:00:58Z","title":"TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 3 inbound Pith citation observations for arXiv:2504.16266."}