{"as_of":"2026-08-09T11:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1a02bcd73b6e0b2d68e09d2e79a2c810f13f033d1286ede660747716ae0e2154","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T20:33:14.055182Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.25655/citation-record","integrity":"/paper/2605.25655/integrity","json":"/paper/2605.25655/citation-record.json","paper":"/paper/2605.25655"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:37663d138a5a1e070f934924cfa5e77263700458d3ddaa7ac7b235a03cbc979c","observation_id":"6d2edf1c-7b5c-4f01-a649-3537258fff8e","resolution":{"observed_at":"2026-06-29T20:33:58.248919Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":"2309.16609","doi":"10.48550/arxiv.2309.16609","metadata_source":"pith","pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen Technical Report","venue":"cs.CL","work_id":"bb1fd52f-6b2f-437c-9516-37bdf6eb9be8","year":2023},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:a0a058fcf155dcb294f8a855eb430bea8626ff0eb6572191f67d250805cb33b0","observation_id":"95e28b52-88d2-4668-90fd-4cf9793b9d6f","resolution":{"observed_at":"2026-06-29T20:33:58.251341Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:fcc236e68da932022a55cfc5342a2cce123ff9628d5428c758091dce4dd4c99b","observation_id":"1b25a901-7741-4fb2-8349-057b0166afb2","resolution":{"observed_at":"2026-06-29T20:33:58.239994Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:33:14.055182Z","title":"Efficient memory management for large language model serving with pagedattention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:1441255a395b884b5d9c91b38476c16658a4d4b7331de5d8bd4f960062d06190","observation_id":"b24729db-6e86-48c9-b3d3-1f65efdda61e","resolution":{"observed_at":"2026-06-29T20:33:14.055182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:33:14.055182Z","title":"TensorRT-LLM,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:b30f2e98b9246af58b79c59b6400daec7827cc6f2c94df665ac130c7b8647844","observation_id":"e28ca0df-cba0-4d5a-bac2-94ae370e5abf","resolution":{"observed_at":"2026-06-29T20:33:14.055182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:33:14.055182Z","title":"Deepspeed-inference: enabling efficient inference of transformer models at unprecedented scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:3e5147c922263fbb38da66c981f1d5db31e65dfb071381e1d185e5cfb5ff7900","observation_id":"657778f7-9fef-4f4c-89ee-d74f0b859b80","resolution":{"observed_at":"2026-06-29T20:33:14.055182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:33:14.055182Z","title":"Large- scale parallelization and optimization of lattice qcd on tianhe new generation supercomputer,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:77b7dacc1822b63552a49a0d2a998e9d8822d42184cf462575904f2931eb2771","observation_id":"a82dc052-3a63-447a-b7f9-a44ca9487c34","resolution":{"observed_at":"2026-06-29T20:33:14.055182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:33:14.055182Z","title":"Mt-3000: a heterogeneous multi-zone processor for hpc,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:70db610a610651684d41d2a082ed84952b7578851147d9b9cf42f29fc38f601e","observation_id":"7e9a3747-e92f-4425-857a-33790a644fc7","resolution":{"observed_at":"2026-06-29T20:33:14.055182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:33:14.055182Z","title":"Performance analysis of cuda, openacc and openmp programming models on tesla v100 gpu,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:1895d290b19e6ed055a2045cda7bdf398788b2bafd6746b62dd05ebd34fdba04","observation_id":"fa0119f3-4f5a-4d2c-b148-846aa8e24575","resolution":{"observed_at":"2026-06-29T20:33:14.055182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:33:14.055182Z","title":"Mpi: a standard message passing interface,","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:9730320912b9a7f2b0e14c8c59ae7590396e84035e318a6bb28d76348984af0d","observation_id":"2ae047b4-1459-4805-b46b-f74eb8462b31","resolution":{"observed_at":"2026-06-29T20:33:14.055182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:33:14.055182Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:ead7fc61ceae05f7f151eab09ff194599d1de048e4361a6212a706b30fafddc5","observation_id":"d2a6cd98-85fd-4ac9-8cfd-58928f2157a2","resolution":{"observed_at":"2026-06-29T20:33:14.055182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.11943","last_updated":"2021-03-22T15:34:39Z","snapshot_observed_at":"2026-08-04T14:58:50.151028Z","submitted_at":"2021-03-22T15:34:39Z","title":"BERT: A Review of Applications in Natural Language Processing and Understanding","version":1},"cited_work":{"arxiv_id":"2103.11943","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.11943","snapshot_observed_at":"2026-07-04T18:30:02.731979Z","title":"BERT: a review of applications in natural language processing and understanding","venue":null,"work_id":"ebbf0647-e1b6-48e8-b254-fa251335a333","year":2021},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"cited_paper":"/paper/2103.11943","citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:f2f489303370290bbe3fa8a355dfd3aebe6d5353cdfc956f994fed5f82c97aa4","observation_id":"7d4df453-538a-457d-ad6a-318341307ef8","resolution":{"observed_at":"2026-06-29T20:33:58.246290Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:33:14.055182Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:d32a935702b657d21b4a466f971983d6432fe43f04eff2f3f56ea93f3cbd4bcd","observation_id":"0c4244fa-f83a-492e-9ffd-eeb09a8c6d1a","resolution":{"observed_at":"2026-06-29T20:33:14.055182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:33:14.055182Z","title":"Language mod- els are few-shot learners,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:3208e3dc4bb38d7c8ac240065b63c380306ebd2c75ad5bcd850e93a70fc227c8","observation_id":"ab7d1c02-3047-42c2-8ab1-b67ecc721b36","resolution":{"observed_at":"2026-06-29T20:33:14.055182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:af1b1340ff08e3b3c2f535fd748eefed63455cbe28d055a07dc5b364db32c6f7","observation_id":"6aa8fd6e-d620-4b6c-bb35-add9719f99f9","resolution":{"observed_at":"2026-06-29T20:33:58.243502Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:60c147ede4476d999c5d2f4a1af464877e47776cccfdbe87d29a083e7db497ec","observation_id":"1dea15d5-e615-4a35-a884-d6ba80c9ff79","resolution":{"observed_at":"2026-06-29T20:33:58.246240Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:e6fa5d8fc854a967ecc92a79b53046036c18e9453d48b92a3c165f2fa189a90e","observation_id":"21f14377-3571-4e4f-9ba5-b10509f94842","resolution":{"observed_at":"2026-06-29T20:33:58.272198Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":"2407.10671","doi":"10.18653/v1/2024.naacl-long.246","metadata_source":"pith","pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2 Technical Report","venue":"cs.CL","work_id":"a1857881-ab9b-4b80-9b5f-9ae4b5c2566d","year":2024},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:0d13733b689539ee0e9e61654c0b2166a480c47e59bc06a6fb9660d92174c97d","observation_id":"8ebbd727-232e-4a78-bfff-41660976d5a1","resolution":{"observed_at":"2026-06-29T20:33:58.275350Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T08:38:54.025062Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":"2210.17323","doi":"10.48550/arxiv.2210.17323","metadata_source":"pith","pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","venue":"cs.LG","work_id":"19ed8c44-202a-48f6-8169-637d5a5f2408","year":2022},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:37687edd625de1ddcfdf924925fcc12dfe738a1496c2af8672186b347fca5d11","observation_id":"b1f198ea-f712-4f87-bab2-ab647243519b","resolution":{"observed_at":"2026-06-29T20:33:58.264414Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-17T20:22:03.028003+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-17T20:22:03.028003+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:33:14.055182Z","title":"Awq: Activation-aware weight quanti- zation for on-device llm compression and acceleration,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:68e9f739021d778a584871e3134dc2bf4dbe331d6a30d990a8ef35a18510f637","observation_id":"ddbe6671-80a4-4826-a793-95ae20a5bb46","resolution":{"observed_at":"2026-06-29T20:33:14.055182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:33:14.055182Z","title":"Sparsegpt: Massive language models can be accurately pruned in one-shot,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:e3efe2b38db62db83f6e61c2d6fca6b7a37f746ae1b5b47b8c9ee0bbacaf36ca","observation_id":"40a76898-7317-486d-9e37-429289e25055","resolution":{"observed_at":"2026-06-29T20:33:14.055182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:33:14.055182Z","title":"Llm-pruner: On the structural pruning of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:f42ac8d5c74ed67f2b653685e88810fc11f93e1c38451921d16a1b07ef4ce08a","observation_id":"f327fb1e-5677-4a0f-910b-04398689bbb4","resolution":{"observed_at":"2026-06-29T20:33:14.055182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08543","last_updated":"2026-01-31T09:16:35Z","snapshot_observed_at":"2026-08-02T20:03:32.798288Z","submitted_at":"2023-06-14T14:44:03Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","version":6},"cited_work":{"arxiv_id":"2306.08543","doi":"10.48550/arxiv.2306.08543","metadata_source":"pith","pith_arxiv_id":"2306.08543","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","venue":"cs.CL","work_id":"16edb291-dd18-41c5-8486-c6c715ec5311","year":2023},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"cited_paper":"/paper/2306.08543","citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:737b9950d89587aa10404cf1e215566f548febb06996b6d1c368471384524848","observation_id":"f3dc798f-e95f-4069-b52d-59445f591d66","resolution":{"observed_at":"2026-06-29T20:33:58.259894Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:33:14.055182Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:f18330030745c48da1e4c056d201811423ab178495af5db799ec85c64551a641","observation_id":"9f542ca8-bdeb-465e-ba21-48a3f60379c6","resolution":{"observed_at":"2026-06-29T20:33:14.055182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":"2004.05150","doi":"10.48550/arxiv.2004.05150","metadata_source":"pith","pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Longformer: The Long-Document Transformer","venue":"cs.CL","work_id":"abea7a44-6668-4de7-aab6-f53a6e5aa088","year":2020},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:2d263c01e92cae956e3573447116a07f52776753127794aa93199da373869996","observation_id":"888d6e6f-091a-4a3a-85ba-1992102554e9","resolution":{"observed_at":"2026-06-29T20:33:58.266584Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":"2006.04768","doi":"10.48550/arxiv.2006.04768","metadata_source":"pith","pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Linformer: Self-Attention with Linear Complexity","venue":"cs.LG","work_id":"4b717b51-6098-45d0-8e9e-b69bef651bc3","year":2020},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:9a94c199689918d39b23839acebcb790c54cb0e46870d4b5105d13deae440aa3","observation_id":"542292c2-31d1-45dd-bcbd-b8c389648252","resolution":{"observed_at":"2026-06-29T20:33:58.269898Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04451","last_updated":"2020-02-18T16:01:18Z","snapshot_observed_at":"2026-07-06T08:50:12.690900Z","submitted_at":"2020-01-13T18:38:28Z","title":"Reformer: The Efficient Transformer","version":2},"cited_work":{"arxiv_id":"2001.04451","doi":"10.48550/arxiv.2001.04451","metadata_source":"pith","pith_arxiv_id":"2001.04451","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reformer: The Efficient Transformer","venue":"cs.LG","work_id":"eb3dbae4-931f-40ab-a37b-507a35f42712","year":2020},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"cited_paper":"/paper/2001.04451","citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:5b7ff172a4af94047fa68bbae91697f7eb5ac7245ca47c3695c0a7ca305f0adb","observation_id":"d95be2c3-ca5a-46fc-acc9-0b2073717876","resolution":{"observed_at":"2026-06-29T20:33:58.272420Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:50:01.947571+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:50:01.947571+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":"2305.13245","doi":"10.48550/arxiv.2305.13245","metadata_source":"pith","pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","venue":"cs.CL","work_id":"b73ad5b2-e553-4c71-b0c9-67e67ba7b158","year":2023},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:77068911765af271fab5c77427004f573ce20f3e66d6d8604498945bfea75549","observation_id":"45e8b6c0-c945-460d-948b-a0152440e980","resolution":{"observed_at":"2026-06-29T20:33:58.257118Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:33:14.055182Z","title":"Scissorhands: Exploiting the persistence of importance hypothesis for llm kv cache compression at test time,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:e6bd9fcee34ebc6bc73a85219ddca09f4a01b0eb7fa5d069e833f88bbbc29bca","observation_id":"c3ca5121-d7de-485e-b279-63a70b105c69","resolution":{"observed_at":"2026-06-29T20:33:14.055182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":"2309.17453","doi":"10.48550/arxiv.2309.17453","metadata_source":"pith","pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Streaming Language Models with Attention Sinks","venue":"cs.CL","work_id":"a8d25452-c237-48c9-88a4-682717c3979a","year":2023},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:95b685a7d75f78ee5532c0e310b799c41cdd8d84866eaa2791da4937eb73ed7a","observation_id":"e3237c88-7dea-4707-bf75-c063fed24f3e","resolution":{"observed_at":"2026-06-29T20:33:58.255008Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:33:14.055182Z","title":"Orca: A distributed serving system for{Transformer-Based}generative models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:f6d0787abed5d1193d8c0c45f81a754ac24451395d0347d00762d764f79d24e3","observation_id":"f1090996-0c2c-44cb-bd2f-5cf32274a2a9","resolution":{"observed_at":"2026-06-29T20:33:14.055182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:33:14.055182Z","title":"Text Generation Inference,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:f81ac2979fe76f275541b7c5802e1e6c458d4ba7d74e55c0789ae8cc56f0c805","observation_id":"233a8c46-11e2-40e9-9cd8-bc11ec110e61","resolution":{"observed_at":"2026-06-29T20:33:14.055182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:33:14.055182Z","title":"Flexgen: High-throughput generative inference of large language models with a single gpu,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:369dcf5254f1a216e6135f02dce1e2b23b98c95f88640e601219e2b21fb8df9f","observation_id":"7bad1ad4-8492-4b17-8cd0-4099a8cf1dc4","resolution":{"observed_at":"2026-06-29T20:33:14.055182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:33:14.055182Z","title":"{DistServe}: Disaggregating prefill and decoding for goodput-optimized large language model serving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:928ad5c4d642f8c9752c360a51dfc7338f6ddd05899348d5cfd66d78b705f6da","observation_id":"5361c5e1-7e74-4f72-afda-c3f52ffbf880","resolution":{"observed_at":"2026-06-29T20:33:14.055182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:33:14.055182Z","title":"Efficient processing of deep neural networks: A tutorial and survey,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:586a2533783e353a7c41ebf75975a24a769ba719953b2019e5234be6daed82a7","observation_id":"889c0a49-7b04-4a19-8809-a10db6997573","resolution":{"observed_at":"2026-06-29T20:33:14.055182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:33:14.055182Z","title":"Roofline: an insightful visual performance model for multicore architectures,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:6f059fb5f78baef98e66859a705118894dc23e890c6bd87e28b13e8dabbd2c78","observation_id":"894cf718-d9e1-42dc-bc74-dea31e4d690d","resolution":{"observed_at":"2026-06-29T20:33:14.055182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:33:14.055182Z","title":"Optimizing general matrix multiplications on modern multi-core dsps,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:7261d3c8a11aba3c2f6c2621c144ecdf92ca1506446abc9de5f09b93bb9d0f95","observation_id":"41e96e60-b30d-4773-abe3-6f9f0800e040","resolution":{"observed_at":"2026-06-29T20:33:14.055182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:33:14.055182Z","title":"He served as the chief scientist of China National High Technology Program on high perfor- mance computing for 20 years","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T20:33:14.055182Z"},"links":{"citing_paper":"/paper/2605.25655"},"observation_digest":"sha256:2b1576f222f075729ccb33c69809e3f205c94e74f89f646c76e79c7f526a7bd9","observation_id":"6629f8c6-9f15-4ee2-a633-2beda16cb7db","resolution":{"observed_at":"2026-06-29T20:33:14.055182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.25655","last_updated":"2026-05-25T10:03:25Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:03:25Z","title":"Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":15,"verified_fuzzy":0},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2605.25655."}