{"as_of":"2026-08-05T08:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:611fd089a7fa7d988f5d1edb6c9a9b16b87c4d65ad0885787d9e5a215c36cf87","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":19,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T09:50:33.189053Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":47,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.06865","last_updated":"2023-06-12T07:48:53Z","snapshot_observed_at":"2026-07-06T15:02:25.281739Z","submitted_at":"2023-03-13T05:19:28Z","title":"FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU","version":2},"cited_work":{"arxiv_id":"2303.06865","doi":"10.48550/arxiv.2303.06865","metadata_source":"pith","pith_arxiv_id":"2303.06865","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Xie, Z., Chen, B., Barrett, C., Gonzalez, J","venue":"cs.LG","work_id":"c99785d7-2d72-4d2f-8363-f4db53cf669f","year":2023},"citing_paper":{"arxiv_id":"2306.00978","last_updated":"2026-04-25T06:58:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T17:59:10Z","title":"AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration","version":6},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-24T08:27:35.798991Z"},"links":{"cited_paper":"/paper/2303.06865","citing_paper":"/paper/2306.00978"},"observation_digest":"sha256:b5194a27f6a5d70330722710b0bdbc2df8b756efd3b7b636ac5b87403dec7ab4","observation_id":"b6cb1e59-f963-43d7-9a41-e89dea8d448a","resolution":{"observed_at":"2026-05-24T08:29:11.378091Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06865","last_updated":"2023-06-12T07:48:53Z","snapshot_observed_at":"2026-07-06T15:02:25.281739Z","submitted_at":"2023-03-13T05:19:28Z","title":"FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU","version":2},"cited_work":{"arxiv_id":"2303.06865","doi":"10.48550/arxiv.2303.06865","metadata_source":"pith","pith_arxiv_id":"2303.06865","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Xie, Z., Chen, B., Barrett, C., Gonzalez, J","venue":"cs.LG","work_id":"c99785d7-2d72-4d2f-8363-f4db53cf669f","year":2023},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2303.06865","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:a1cd26d93aed48cd2191df09d9b211f536c78f8241273fa5f7905f4e7bcf89c1","observation_id":"ad34b387-962f-4c5c-8a3c-889b798ae04d","resolution":{"observed_at":"2026-05-17T18:00:50.435347Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06865","last_updated":"2023-06-12T07:48:53Z","snapshot_observed_at":"2026-07-06T15:02:25.281739Z","submitted_at":"2023-03-13T05:19:28Z","title":"FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU","version":2},"cited_work":{"arxiv_id":"2303.06865","doi":"10.48550/arxiv.2303.06865","metadata_source":"pith","pith_arxiv_id":"2303.06865","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Xie, Z., Chen, B., Barrett, C., Gonzalez, J","venue":"cs.LG","work_id":"c99785d7-2d72-4d2f-8363-f4db53cf669f","year":2023},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"cited_paper":"/paper/2303.06865","citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:403d34674d8810a4a9f58a32741ce451d57e3c53303c3ec61b83093383459237","observation_id":"b514fe48-8fb9-4ec3-9311-fb3b4b968682","resolution":{"observed_at":"2026-05-12T15:03:07.800919Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06865","last_updated":"2023-06-12T07:48:53Z","snapshot_observed_at":"2026-07-06T15:02:25.281739Z","submitted_at":"2023-03-13T05:19:28Z","title":"FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU","version":2},"cited_work":{"arxiv_id":"2303.06865","doi":"10.48550/arxiv.2303.06865","metadata_source":"pith","pith_arxiv_id":"2303.06865","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Xie, Z., Chen, B., Barrett, C., Gonzalez, J","venue":"cs.LG","work_id":"c99785d7-2d72-4d2f-8363-f4db53cf669f","year":2023},"citing_paper":{"arxiv_id":"2604.07815","last_updated":"2026-04-09T05:15:16Z","snapshot_observed_at":"2026-07-06T22:57:05.146373Z","submitted_at":"2026-04-09T05:15:16Z","title":"AsyncTLS: Efficient Generative LLM Inference with Asynchronous Two-level Sparse Attention","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T17:57:59.636975Z"},"links":{"cited_paper":"/paper/2303.06865","citing_paper":"/paper/2604.07815"},"observation_digest":"sha256:65421378a0e8d80647e3e24dc87aea783fe968597a0c1acd5d94c8de922941fb","observation_id":"f7f8442b-e6d9-4ea7-9d6c-ac4d4c74212a","resolution":{"observed_at":"2026-05-11T05:45:57.821474Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06865","last_updated":"2023-06-12T07:48:53Z","snapshot_observed_at":"2026-07-06T15:02:25.281739Z","submitted_at":"2023-03-13T05:19:28Z","title":"FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU","version":2},"cited_work":{"arxiv_id":"2303.06865","doi":"10.48550/arxiv.2303.06865","metadata_source":"pith","pith_arxiv_id":"2303.06865","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Xie, Z., Chen, B., Barrett, C., Gonzalez, J","venue":"cs.LG","work_id":"c99785d7-2d72-4d2f-8363-f4db53cf669f","year":2023},"citing_paper":{"arxiv_id":"2604.25698","last_updated":"2026-07-07T03:27:09Z","snapshot_observed_at":"2026-08-03T13:06:29.040293Z","submitted_at":"2026-04-28T14:24:58Z","title":"Reference-Augmented Learning for Precise Tracking Policy of Tendon-Driven Continuum Robots","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-01T08:53:21.013613Z"},"links":{"cited_paper":"/paper/2303.06865","citing_paper":"/paper/2604.25698"},"observation_digest":"sha256:9c3fb9bd081621da4e267050e1cb39cd4a4a8ec7a8bc93d6f40282240206aa57","observation_id":"f5c6d858-d87e-44cf-a489-0a3aa6738bcd","resolution":{"observed_at":"2026-07-01T08:55:34.776645Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06865","last_updated":"2023-06-12T07:48:53Z","snapshot_observed_at":"2026-07-06T15:02:25.281739Z","submitted_at":"2023-03-13T05:19:28Z","title":"FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU","version":2},"cited_work":{"arxiv_id":"2303.06865","doi":"10.48550/arxiv.2303.06865","metadata_source":"pith","pith_arxiv_id":"2303.06865","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Xie, Z., Chen, B., Barrett, C., Gonzalez, J","venue":"cs.LG","work_id":"c99785d7-2d72-4d2f-8363-f4db53cf669f","year":2023},"citing_paper":{"arxiv_id":"2604.25699","last_updated":"2026-08-04T17:18:30Z","snapshot_observed_at":"2026-08-05T07:53:08.014501Z","submitted_at":"2026-04-28T14:26:22Z","title":"NVLLM: A 3D NAND-Centric Architecture Enabling Edge on-Device LLM Inference","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-07T14:14:33.939889Z"},"links":{"cited_paper":"/paper/2303.06865","citing_paper":"/paper/2604.25699"},"observation_digest":"sha256:59d5ea9a930a4623f823dde16aa559a94a3466026e44326c73148a365bbff0e3","observation_id":"a64111e7-1b16-4e76-9299-57d4b5e2b293","resolution":{"observed_at":"2026-05-12T00:46:13.425186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06865","last_updated":"2023-06-12T07:48:53Z","snapshot_observed_at":"2026-07-06T15:02:25.281739Z","submitted_at":"2023-03-13T05:19:28Z","title":"FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU","version":2},"cited_work":{"arxiv_id":"2303.06865","doi":"10.48550/arxiv.2303.06865","metadata_source":"pith","pith_arxiv_id":"2303.06865","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Xie, Z., Chen, B., Barrett, C., Gonzalez, J","venue":"cs.LG","work_id":"c99785d7-2d72-4d2f-8363-f4db53cf669f","year":2023},"citing_paper":{"arxiv_id":"2605.11733","last_updated":"2026-05-12T08:15:04Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T08:15:04Z","title":"Position: LLM Inference Should Be Evaluated as Energy-to-Token Production","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-13T05:17:24.147248Z"},"links":{"cited_paper":"/paper/2303.06865","citing_paper":"/paper/2605.11733"},"observation_digest":"sha256:2a276748e3615e05a64ab41329db6db63158e52cd3bf7309faa3f18e58ac1448","observation_id":"7da1e05c-8151-459e-b767-4162b988f6b2","resolution":{"observed_at":"2026-05-13T05:27:19.393998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06865","last_updated":"2023-06-12T07:48:53Z","snapshot_observed_at":"2026-07-06T15:02:25.281739Z","submitted_at":"2023-03-13T05:19:28Z","title":"FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU","version":2},"cited_work":{"arxiv_id":"2303.06865","doi":"10.48550/arxiv.2303.06865","metadata_source":"pith","pith_arxiv_id":"2303.06865","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Xie, Z., Chen, B., Barrett, C., Gonzalez, J","venue":"cs.LG","work_id":"c99785d7-2d72-4d2f-8363-f4db53cf669f","year":2023},"citing_paper":{"arxiv_id":"2605.20179","last_updated":"2026-05-19T17:59:08Z","snapshot_observed_at":"2026-08-02T06:21:17.194998Z","submitted_at":"2026-05-19T17:59:08Z","title":"TIDE: Efficient and Lossless MoE Diffusion LLM Inference with I/O-aware Expert Offload","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T05:08:07.318040Z"},"links":{"cited_paper":"/paper/2303.06865","citing_paper":"/paper/2605.20179"},"observation_digest":"sha256:e3cd0622ef8042157ed959cb5975a8e880050d05440ba675fefa923dccccf1c3","observation_id":"9338576d-07b3-400e-a5f0-267a21c1bbab","resolution":{"observed_at":"2026-05-20T05:13:03.728349Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06865","last_updated":"2023-06-12T07:48:53Z","snapshot_observed_at":"2026-07-06T15:02:25.281739Z","submitted_at":"2023-03-13T05:19:28Z","title":"FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU","version":2},"cited_work":{"arxiv_id":"2303.06865","doi":"10.48550/arxiv.2303.06865","metadata_source":"pith","pith_arxiv_id":"2303.06865","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Xie, Z., Chen, B., Barrett, C., Gonzalez, J","venue":"cs.LG","work_id":"c99785d7-2d72-4d2f-8363-f4db53cf669f","year":2023},"citing_paper":{"arxiv_id":"2605.24754","last_updated":"2026-05-23T22:09:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-23T22:09:34Z","title":"Motion-Compensated Weight Compression","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-30T12:58:27.637822Z"},"links":{"cited_paper":"/paper/2303.06865","citing_paper":"/paper/2605.24754"},"observation_digest":"sha256:44792db217ae9ac4a728b726a843b87bfccdf213aaabe49665e0a45505064593","observation_id":"d4f29e81-15f3-4070-8c88-5b061cbee79c","resolution":{"observed_at":"2026-06-30T13:04:40.443077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06865","last_updated":"2023-06-12T07:48:53Z","snapshot_observed_at":"2026-07-06T15:02:25.281739Z","submitted_at":"2023-03-13T05:19:28Z","title":"FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU","version":2},"cited_work":{"arxiv_id":"2303.06865","doi":"10.48550/arxiv.2303.06865","metadata_source":"pith","pith_arxiv_id":"2303.06865","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Xie, Z., Chen, B., Barrett, C., Gonzalez, J","venue":"cs.LG","work_id":"c99785d7-2d72-4d2f-8363-f4db53cf669f","year":2023},"citing_paper":{"arxiv_id":"2605.25550","last_updated":"2026-05-25T08:07:47Z","snapshot_observed_at":"2026-07-31T12:35:46.854130Z","submitted_at":"2026-05-25T08:07:47Z","title":"DisagFusion: Asynchronous Pipeline Parallelism and Elastic Scheduling for Disaggregated Diffusion Serving","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T20:46:51.896596Z"},"links":{"cited_paper":"/paper/2303.06865","citing_paper":"/paper/2605.25550"},"observation_digest":"sha256:36e1c1dd2fa2c752a4df0c08540fe0b279faa656b1cd6e1692425eeb7083dd74","observation_id":"d6eb5ba2-eb03-402c-8623-afc058fd5251","resolution":{"observed_at":"2026-06-29T20:53:57.615932Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06865","last_updated":"2023-06-12T07:48:53Z","snapshot_observed_at":"2026-07-06T15:02:25.281739Z","submitted_at":"2023-03-13T05:19:28Z","title":"FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU","version":2},"cited_work":{"arxiv_id":"2303.06865","doi":"10.48550/arxiv.2303.06865","metadata_source":"pith","pith_arxiv_id":"2303.06865","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Xie, Z., Chen, B., Barrett, C., Gonzalez, J","venue":"cs.LG","work_id":"c99785d7-2d72-4d2f-8363-f4db53cf669f","year":2023},"citing_paper":{"arxiv_id":"2605.28095","last_updated":"2026-05-27T07:52:03Z","snapshot_observed_at":"2026-07-06T23:37:45.223562Z","submitted_at":"2026-05-27T07:52:03Z","title":"SiDP: Memory-Efficient Data Parallelism for Offline LLM Inference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T10:07:06.141581Z"},"links":{"cited_paper":"/paper/2303.06865","citing_paper":"/paper/2605.28095"},"observation_digest":"sha256:da6243ac935ed2f60ecae07e9000e853a7c11f235583154ad9a6cdcb77986942","observation_id":"17bb96a4-f528-44b7-a38b-8d275546cc8f","resolution":{"observed_at":"2026-06-29T10:13:17.841684Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06865","last_updated":"2023-06-12T07:48:53Z","snapshot_observed_at":"2026-07-06T15:02:25.281739Z","submitted_at":"2023-03-13T05:19:28Z","title":"FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU","version":2},"cited_work":{"arxiv_id":"2303.06865","doi":"10.48550/arxiv.2303.06865","metadata_source":"pith","pith_arxiv_id":"2303.06865","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Xie, Z., Chen, B., Barrett, C., Gonzalez, J","venue":"cs.LG","work_id":"c99785d7-2d72-4d2f-8363-f4db53cf669f","year":2023},"citing_paper":{"arxiv_id":"2606.04032","last_updated":"2026-06-04T17:08:43Z","snapshot_observed_at":"2026-07-06T23:44:14.261541Z","submitted_at":"2026-06-01T20:59:05Z","title":"Do Transformers Need Three Projections? Systematic Study of QKV Variants","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-06-28T15:14:49.475561Z"},"links":{"cited_paper":"/paper/2303.06865","citing_paper":"/paper/2606.04032"},"observation_digest":"sha256:83c206c366facfc9e1ca6d2dcd4753d53f2484b096e8c27e8843e7497f9d8f6e","observation_id":"f44a03d9-0f6a-4f66-af40-cfea99326fcf","resolution":{"observed_at":"2026-07-01T22:36:17.291462Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06865","last_updated":"2023-06-12T07:48:53Z","snapshot_observed_at":"2026-07-06T15:02:25.281739Z","submitted_at":"2023-03-13T05:19:28Z","title":"FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU","version":2},"cited_work":{"arxiv_id":"2303.06865","doi":"10.48550/arxiv.2303.06865","metadata_source":"pith","pith_arxiv_id":"2303.06865","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Xie, Z., Chen, B., Barrett, C., Gonzalez, J","venue":"cs.LG","work_id":"c99785d7-2d72-4d2f-8363-f4db53cf669f","year":2023},"citing_paper":{"arxiv_id":"2606.09508","last_updated":"2026-06-08T14:02:18Z","snapshot_observed_at":"2026-08-03T05:12:39.957667Z","submitted_at":"2026-06-08T14:02:18Z","title":"From Rigid to Dynamic: Entropy-Guided Adaptive Inference for Long-Context LLMs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-27T16:57:02.709967Z"},"links":{"cited_paper":"/paper/2303.06865","citing_paper":"/paper/2606.09508"},"observation_digest":"sha256:33d46e746b266d5373b9b7eeecfa11d7b907904360c08b996ac96c9c3db7d170","observation_id":"e653dc00-faa0-4e9f-9722-0d681cb278c4","resolution":{"observed_at":"2026-06-27T17:01:07.756499Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06865","last_updated":"2023-06-12T07:48:53Z","snapshot_observed_at":"2026-07-06T15:02:25.281739Z","submitted_at":"2023-03-13T05:19:28Z","title":"FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU","version":2},"cited_work":{"arxiv_id":"2303.06865","doi":"10.48550/arxiv.2303.06865","metadata_source":"pith","pith_arxiv_id":"2303.06865","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Xie, Z., Chen, B., Barrett, C., Gonzalez, J","venue":"cs.LG","work_id":"c99785d7-2d72-4d2f-8363-f4db53cf669f","year":2023},"citing_paper":{"arxiv_id":"2606.24033","last_updated":"2026-06-23T00:17:48Z","snapshot_observed_at":"2026-08-02T14:58:46.342813Z","submitted_at":"2026-06-23T00:17:48Z","title":"RoPE-Aware Bit Allocation for KV-Cache Quantization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T01:05:13.790381Z"},"links":{"cited_paper":"/paper/2303.06865","citing_paper":"/paper/2606.24033"},"observation_digest":"sha256:c6b7258bdb97e9349bedd1c800ae6afaf2b0899a2a494c6e59b8827144b257f4","observation_id":"9fc2fa37-c415-4186-8e06-9dd863008722","resolution":{"observed_at":"2026-07-04T15:59:57.345142Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06865","last_updated":"2023-06-12T07:48:53Z","snapshot_observed_at":"2026-07-06T15:02:25.281739Z","submitted_at":"2023-03-13T05:19:28Z","title":"FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU","version":2},"cited_work":{"arxiv_id":"2303.06865","doi":"10.48550/arxiv.2303.06865","metadata_source":"pith","pith_arxiv_id":"2303.06865","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Xie, Z., Chen, B., Barrett, C., Gonzalez, J","venue":"cs.LG","work_id":"c99785d7-2d72-4d2f-8363-f4db53cf669f","year":2023},"citing_paper":{"arxiv_id":"2607.01065","last_updated":"2026-07-01T15:25:21Z","snapshot_observed_at":"2026-07-07T00:06:39.908636Z","submitted_at":"2026-07-01T15:25:21Z","title":"GSRQ: Gain-Shape Residual Quantization for Sub-1-bit KV Cache","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-02T15:55:40.177742Z"},"links":{"cited_paper":"/paper/2303.06865","citing_paper":"/paper/2607.01065"},"observation_digest":"sha256:3009548c512d9bdcc7a74fd9143524fb0a521b0b868647834709d0c00b5e8e24","observation_id":"00bd9ec3-3e97-43af-8c72-a27711523849","resolution":{"observed_at":"2026-07-02T15:57:06.396714Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06865","last_updated":"2023-06-12T07:48:53Z","snapshot_observed_at":"2026-07-06T15:02:25.281739Z","submitted_at":"2023-03-13T05:19:28Z","title":"FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU","version":2},"cited_work":{"arxiv_id":"2303.06865","doi":"10.48550/arxiv.2303.06865","metadata_source":"pith","pith_arxiv_id":"2303.06865","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Xie, Z., Chen, B., Barrett, C., Gonzalez, J","venue":"cs.LG","work_id":"c99785d7-2d72-4d2f-8363-f4db53cf669f","year":2023},"citing_paper":{"arxiv_id":"2607.08032","last_updated":"2026-07-09T01:15:03Z","snapshot_observed_at":"2026-08-02T16:38:21.894642Z","submitted_at":"2026-07-09T01:15:03Z","title":"What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents","version":1},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-07-10T01:26:59.421158Z"},"links":{"cited_paper":"/paper/2303.06865","citing_paper":"/paper/2607.08032"},"observation_digest":"sha256:e711942379c82672479d8d2e5305f49585c6b412c5d11853f07b2ff1047dc96f","observation_id":"c5aacbd5-6a12-4614-8d0d-3a86315c0e78","resolution":{"observed_at":"2026-07-10T01:36:44.214493Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06865","last_updated":"2023-06-12T07:48:53Z","snapshot_observed_at":"2026-07-06T15:02:25.281739Z","submitted_at":"2023-03-13T05:19:28Z","title":"FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.06865","snapshot_observed_at":"2026-08-01T21:09:10.165093Z","title":"Fu, Zhiqiang Xie, Beidi Chen, Clark Barrett, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16184","last_updated":"2026-07-17T17:58:29Z","snapshot_observed_at":"2026-08-05T03:58:48.412708Z","submitted_at":"2026-07-17T17:58:29Z","title":"PagedWeight: Efficient MoE LLM Serving with Dynamic Quality-Aware Weight Quantization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T21:09:10.165093Z"},"links":{"cited_paper":"/paper/2303.06865","citing_paper":"/paper/2607.16184"},"observation_digest":"sha256:9283ed3c81474a52e41d0b7e0fd32bdc32edff2f7bc68d73cabce33ed7750204","observation_id":"470deda4-87b7-40b5-a309-a9f786629989","resolution":{"observed_at":"2026-08-01T21:09:10.165093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06865","last_updated":"2023-06-12T07:48:53Z","snapshot_observed_at":"2026-07-06T15:02:25.281739Z","submitted_at":"2023-03-13T05:19:28Z","title":"FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.06865","snapshot_observed_at":"2026-08-02T09:50:33.189053Z","title":"arXiv:2303.06865","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16248","last_updated":"2026-06-27T01:22:47Z","snapshot_observed_at":"2026-08-05T04:21:35.447834Z","submitted_at":"2026-06-27T01:22:47Z","title":"High-accuracy Low-Bit KV-Cache Quantization via Local Distribution Restoration","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T09:50:33.189053Z"},"links":{"cited_paper":"/paper/2303.06865","citing_paper":"/paper/2607.16248"},"observation_digest":"sha256:c90ffd0cd2c93cb8e08ef08fcd21feb25c9e66b0baa8edfa9bccc6ecc87aebd5","observation_id":"57070d58-0786-4889-b914-0d0d6ffff66f","resolution":{"observed_at":"2026-08-02T09:50:33.189053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06865","last_updated":"2023-06-12T07:48:53Z","snapshot_observed_at":"2026-07-06T15:02:25.281739Z","submitted_at":"2023-03-13T05:19:28Z","title":"FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.06865","snapshot_observed_at":"2026-08-01T18:04:58.812521Z","title":"Flexgen: High-throughput generative inference of large language models with a single gpu,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17415","last_updated":"2026-07-19T21:22:22Z","snapshot_observed_at":"2026-08-01T18:04:56.607041Z","submitted_at":"2026-07-19T21:22:22Z","title":"Transition-Aware Backend Dispatch for Edge LLM Inference","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:58.812521Z"},"links":{"cited_paper":"/paper/2303.06865","citing_paper":"/paper/2607.17415"},"observation_digest":"sha256:d643bc254580551a1ae4e9545895b9548154e844c42323da16a91e95d3a5f8a4","observation_id":"985de2a4-2f50-4365-b08d-a1b33ec5e371","resolution":{"observed_at":"2026-08-01T18:04:58.812521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2303.06865/citation-record","integrity":"/paper/2303.06865/integrity","json":"/paper/2303.06865/citation-record.json","paper":"/paper/2303.06865"},"outbound":[],"paper":{"arxiv_id":"2303.06865","last_updated":"2023-06-12T07:48:53Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T15:02:25.281739Z","submitted_at":"2023-03-13T05:19:28Z","title":"FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 19 inbound Pith citation observations for arXiv:2303.06865."}