{"as_of":"2026-08-03T21:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:161f315070e1e86905d90edbba050202319f928f5217462a9e669a1de699330b","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T02:48:18.330339Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T21:09:09.632043Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.18529","snapshot_observed_at":"2026-08-01T21:09:09.632043Z","title":"HybridGen: Efficient LLM generative inference via CPU-GPU hybrid computing, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16184","last_updated":"2026-07-17T17:58:29Z","snapshot_observed_at":"2026-08-03T15:40:28.200309Z","submitted_at":"2026-07-17T17:58:29Z","title":"PagedWeight: Efficient MoE LLM Serving with Dynamic Quality-Aware Weight Quantization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T21:09:09.632043Z"},"links":{"cited_paper":"/paper/2604.18529","citing_paper":"/paper/2607.16184"},"observation_digest":"sha256:9dfb29c5c71d4a28efc6477ad78c36802675bada5d1e89f5a198f44ddb8cd665","observation_id":"7ef6d700-32a1-4f43-a1a4-14841684c2f8","resolution":{"observed_at":"2026-08-01T21:09:09.632043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.18529/citation-record","integrity":"/paper/2604.18529/integrity","json":"/paper/2604.18529/citation-record.json","paper":"/paper/2604.18529"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"76e2b9fe-5c42-4763-b2fa-6e26f826de87","year":2022},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:ef5f588612744ef9ba54e0efe55966f46047cfb56d33ae2f332f2f6808236315","observation_id":"62b20ab4-46a3-40fa-861d-1e253f799089","resolution":{"observed_at":"2026-05-22T19:22:00.117518Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"898be971-d669-4c75-af34-0c9e64f51b04","year":2024},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:e64c7ce3976be48268492ee4f3cdcfb331fb38310027af86b41554aad24c2a7d","observation_id":"fd8c002f-7794-4580-8d2f-66e13e415024","resolution":{"observed_at":"2026-05-22T19:22:00.120330Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14782","last_updated":"2026-05-31T00:04:33Z","snapshot_observed_at":"2026-08-02T05:44:43.939336Z","submitted_at":"2024-05-23T16:50:49Z","title":"Lessons from the Trenches on Reproducible Evaluation of Language Models","version":3},"cited_work":{"arxiv_id":"2405.14782","doi":"10.48550/arxiv.2405.14782","metadata_source":"pith","pith_arxiv_id":"2405.14782","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Lessons from the Trenches on Reproducible Evaluation of Language Models","venue":"cs.CL","work_id":"47b597a2-a355-4305-b1e4-80666b394ccd","year":2024},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"cited_paper":"/paper/2405.14782","citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:f46000d6fec0bb992898082462f22a2d3d7f673e4017907156c46edada8b843c","observation_id":"ec778ea7-a6a6-43fa-9307-44b1d5cadad4","resolution":{"observed_at":"2026-05-16T18:44:50.211576Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:45.557591+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:45.557591+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"180966e1-2207-421c-a6ac-c18b075004e7","year":2020},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:7a0f59934892ab75430bf530e835e64142f8fb914333454b32e12c4ac65ebc0c","observation_id":"016aa677-6fac-4a7c-9cf6-8e4825e56472","resolution":{"observed_at":"2026-05-22T19:22:00.170923Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9940.370726","doi":"10.1145/3669940.3707260","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"InProceedings of the 30th ACM International Conference on Architectural Support for Programming Languages and Operating Systems, Volume 1(Rotterdam, Netherlands)(ASPLOS ’25)","venue":null,"work_id":"9c5c0b40-d793-45bb-9da5-92d3d64d8555","year":2025},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:e2d3a774cd524cdeb7a3b3475ac98001f3acf917ba0767c2e132c458aa777ed6","observation_id":"f1641f35-4272-4b6b-b1c2-61c12af56784","resolution":{"observed_at":"2026-05-10T02:48:26.439520Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Accessed November 2025","venue":null,"work_id":"557c2721-e668-43a0-9fdc-5fe6d5ae72fa","year":2025},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:2fae110650c60798fc7ba41081a3656da48ebfdcf72a944aa575fe27517999c3","observation_id":"59921c60-abf9-4b0d-bba5-f0aeb786217a","resolution":{"observed_at":"2026-05-22T19:22:00.139215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e78c5d16-280c-4697-9f42-604a690ef8e4","year":null},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:f0bb67dc423bc41d2cc0bf44bb77f2ece263006a6f942c984197f3c58d7b7965","observation_id":"ac04a6fe-30bb-47a7-a0f8-22093f9bc7a9","resolution":{"observed_at":"2026-05-22T19:25:04.577946Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-07-06T21:22:17.145779Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"cited_work":{"arxiv_id":"2505.07203","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07203","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications.arXiv preprint arXiv:2505.07203","venue":null,"work_id":"23f46b9d-8549-49c9-955d-9dff02ed53f4","year":2025},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"cited_paper":"/paper/2505.07203","citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:6b935185474420de3e6e5fd2916e6aa4d4ac2d8f1d4a8df1449b4af518f51a9e","observation_id":"f8d7267a-7304-4f84-a113-e6452afaff3c","resolution":{"observed_at":"2026-05-10T02:48:27.073874Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"740f0cbe-7ae8-4641-a6f5-fc6119d22b89","year":2024},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:7dcc4af19686df22a15325d04a3efe8a8de904d111252618159f797aa2a4d9ca","observation_id":"fcca7652-81b8-4f7a-93df-e7b63bf2dd9d","resolution":{"observed_at":"2026-05-22T19:22:00.215835Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:ef6d22b38a31506d4b6b9f1b8d18c95890f88b1930a6245f69afc4ed84146628","observation_id":"e1d3ab66-5641-4e35-8342-dfea167095bb","resolution":{"observed_at":"2026-05-17T11:16:32.250514Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1b2fea32-d262-4011-ab9a-67fd258adb3f","year":2021},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:ff2ef8700a8c1b7083b9553ff69eccc5a2199f23935a7ee5c40d23c95c9c2b6b","observation_id":"323bb551-8f17-4304-aab3-5d2798c161d7","resolution":{"observed_at":"2026-05-22T19:22:00.136036Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":"2310.01801","doi":"10.48550/arxiv.2310.01801","metadata_source":"pith","pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","venue":"cs.CL","work_id":"91379982-466d-4895-96f5-079b66259a73","year":2023},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:149964b7c3b49e5c0496080059c92a44a339a28edba93eddae02d6b33b40725b","observation_id":"ff7deec7-ca88-4bf7-a39c-3b413d63759b","resolution":{"observed_at":"2026-05-17T11:11:21.895994Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00979","last_updated":"2025-06-07T14:03:06Z","snapshot_observed_at":"2026-07-06T20:45:17.830647Z","submitted_at":"2025-03-02T18:12:50Z","title":"Dialogue Without Limits: Constant-Sized KV Caches for Extended Responses in LLMs","version":2},"cited_work":{"arxiv_id":"2503.00979","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.00979","snapshot_observed_at":"2026-07-01T22:16:17.068571Z","title":"Dialogue without limits: Constant-sized kv caches for extended responses in llms","venue":null,"work_id":"dec93b5c-4c9d-4d18-9ef7-92dc72ce09b9","year":2025},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"cited_paper":"/paper/2503.00979","citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:cb148c236f21af3ff6574f681fb34e6f6cc24d16b35707c35cd0dae22c55da66","observation_id":"f106ff4f-bcb9-4f75-9f4e-4a6a431f32bb","resolution":{"observed_at":"2026-05-10T02:48:27.080880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:509a342216ec3a3a687c6a72ff0777aa393739cc103db7519b823da6c9bc5987","observation_id":"0f1fb9a6-851b-4c62-96f1-32b588ba5bf6","resolution":{"observed_at":"2026-05-10T02:48:27.078626Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Accessed November 2025","venue":null,"work_id":"c28a2dfc-8f8f-4ab0-9361-4db5ce0635c4","year":2025},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:ab7df9a91876262d8df5545928b58f5b6932ddded01b564d8e871f06f8fba47b","observation_id":"882b027b-c9f7-41bf-a994-039e64c4a6e9","resolution":{"observed_at":"2026-05-22T19:25:04.575787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6641.37162","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"281f3205-fca6-4903-8dde-355f047e836b","year":2025},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:062869bfbea706f587a239f0d27e3eca0757043c0c1a7f3fa39c6889866f790a","observation_id":"7de55fd5-b176-40e1-8d20-47371fba73f5","resolution":{"observed_at":"2026-05-10T02:48:27.071417Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"357eefd9-a166-4e72-aae9-b4322894bc47","year":null},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:9fc7acf845e15837ef7be6e02c18895dc9b8e99040a5351b870a8207e1a9f718","observation_id":"e5feed70-adc8-4ebb-80cc-2e99a763f8f1","resolution":{"observed_at":"2026-05-22T19:22:00.132949Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In Findings of the Association for Computational Linguistics: ACL 2025","venue":null,"work_id":"5690816c-c852-4c72-a9b0-3605b65ab1b3","year":2025},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:003b34f4418cbcd746019f9fa3d4ad0da61ec77293d8c6b58b1a0490bc70509f","observation_id":"d9530f04-112c-4495-adc2-b78c5472185e","resolution":{"observed_at":"2026-05-22T19:22:00.160588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c2a395a8-b7e2-4964-a536-070a21d5b149","year":2025},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:527bdc14db1c46ea60f27c69ad1d466c5a9881743e61ae04c6617107dfc5650a","observation_id":"ecc2fabf-db43-4187-a15a-d92d7f8a6c85","resolution":{"observed_at":"2026-05-22T19:25:04.571815Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5053.373109","doi":"10.1145/3695053.3731092","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Nyx: Virtualizing dataflow execution on shared FPGA platforms","venue":null,"work_id":"0146e853-daf5-4665-b3a1-799c538af412","year":2025},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:4569b991dafe3da7907abd33bb446c885fed7feaaaab1bc8cfa1ea95218f20f7","observation_id":"8bb6983d-d5e9-40cc-9c36-c311745f903f","resolution":{"observed_at":"2026-05-10T02:48:26.457880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9299da2d-5d28-47f1-97ef-dd53337ccde9","year":2022},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:5fb744c742b27d90e2c7b73bb33cc7a1cc7560b35f2ecb61a81c475be1807e75","observation_id":"5492f8f5-a6b3-47a4-ae72-08e2fe89a96e","resolution":{"observed_at":"2026-05-22T19:22:00.184009Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T20:46:34.417090Z","title":null,"venue":null,"work_id":"36114d7f-e448-4db4-b8c6-bf9f86274172","year":null},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:37162c678c5b35c758089b4ad01ee02a7f1f375928d68fef0f547f96e4f79da0","observation_id":"5500f534-b187-4d50-8a4b-aeb9f96a01d8","resolution":{"observed_at":"2026-05-22T19:22:00.187416Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0006.361316","doi":"10.1145/3600006.3613163","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention , booktitle =","venue":null,"work_id":"1b10f2a9-a178-4d23-97fb-8db2354c7e6c","year":2023},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:90ce8a52fddc37361f9033e49eb88c248cab285cfe2ca0d1afd12cdf86e394ef","observation_id":"64c44172-09ec-4f5d-8c1e-d8d8867c4aab","resolution":{"observed_at":"2026-05-10T02:48:26.447170Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"79d06ff6-bef2-43a3-9cd0-0ddb410466b1","year":2024},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:cdef20499460b74785f23f42c3f24d23cdc795726c0971d4d0bf4a9e1dea3fcf","observation_id":"6330ada9-fe4e-4cdf-a550-65b534718baf","resolution":{"observed_at":"2026-05-22T19:22:00.193848Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025.A CXL progress report: The elephant is learning to dance.https://www.eejournal.com/article/a-cxl-progress-report- the-elephant-is-learning-to-dance/","venue":null,"work_id":"832f1d74-95d8-4f30-8949-3520630137b2","year":2025},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:8dea00167f3247d58e71f35efc0dcfe0cbb05b65a6bb6361876aba3c3d08874a","observation_id":"34e174e2-5332-47db-a5ff-f86ac7bffd48","resolution":{"observed_at":"2026-05-22T19:22:00.200636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:37.028489Z","title":null,"venue":null,"work_id":"1070f4bc-62f0-49bf-9642-29132c2cde07","year":null},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:72368db4cbb796d092f8f944601c0984936d8a69cb7b07647607e8074e95820d","observation_id":"6a5ddbcd-6e9e-4e04-8fc0-7cdf005f5eca","resolution":{"observed_at":"2026-05-22T19:22:00.204862Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems 37 (2024), 22947– 22970","venue":null,"work_id":"646af0b2-cf0c-43f1-b91d-aad721e5e629","year":2024},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:818214ddea962f30c58a47cdc71571be0fa4000c1bc9afa6425f752117283ab2","observation_id":"c48b33e6-e6ba-4e4a-b662-be8f827eccd5","resolution":{"observed_at":"2026-05-22T19:22:00.149681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9d3bc7f5-9a29-409f-be15-0ad477bc72ae","year":2024},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:8dbe0203d671c9d010294f90f0cc28bbd0a3a39c75763f97458c710a9a5fcb60","observation_id":"0eedc597-4243-4447-b206-9debfddf297b","resolution":{"observed_at":"2026-05-22T19:22:00.174138Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"aabf1f62-1bf6-498a-80ff-74dd73e4f949","year":2024},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:784bc7cf793bac3adce9b7aaa1a636e71344720005651198788d664eb2873cdf","observation_id":"f972df56-d797-4761-8e44-b17c62ac90ff","resolution":{"observed_at":"2026-05-22T19:22:00.190149Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1b271ef5-57f1-4119-8ea2-9cfe65e43b98","year":null},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:5eab695fbff9ee4c37822cbf1df940c27a22ea7556d8da7a525f93be5eee4a36","observation_id":"6831bc56-b83e-488a-89be-31953da0acb2","resolution":{"observed_at":"2026-05-22T19:22:00.153171Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems 36 (2023), 52342–52364","venue":null,"work_id":"d139b626-c6a0-4e03-b68e-80b01c75d8b1","year":2023},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:97ad2b1f89191e2b377c8ccb0ff99b1515ae59c7d80b9e75c36c6d0ae596be9e","observation_id":"3e8927d5-bccf-42e2-95c2-c5b0b6ec3c67","resolution":{"observed_at":"2026-05-22T19:22:00.167158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9770e0b4-d3f5-48cf-b93c-5bceea5c41e7","year":2023},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:bc2c6c9a01624e0d5460d2edf837cf91eb16f1c6958d1e37fb5227847b0b8b17","observation_id":"aca5ac1d-3565-461b-96e6-6f7e7c5cd0e8","resolution":{"observed_at":"2026-05-22T19:22:00.164065Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"34534121-2114-46c6-8f3c-74d73f8f8848","year":null},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:08b76ff6b6ca07e1412b9716fba7a1d33e9ab9fc561f8b2733ae3e0ddb7d7542","observation_id":"4e8fa6ac-1daf-4cd0-8240-740f34e9a3db","resolution":{"observed_at":"2026-05-22T19:22:00.126765Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02789","last_updated":"2018-09-08T11:47:16Z","snapshot_observed_at":"2026-07-06T06:59:57.168051Z","submitted_at":"2018-09-08T11:47:16Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","version":1},"cited_work":{"arxiv_id":"1809.02789","doi":"10.48550/arxiv.1809.02789","metadata_source":"pith","pith_arxiv_id":"1809.02789","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","venue":"cs.CL","work_id":"b9d68fc0-5b23-4def-bc5e-6ad71d64eec6","year":2018},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"cited_paper":"/paper/1809.02789","citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:292f72fe1311a02fb096a86908ed7ad76e8cfce29e9d021dee7dde4f5c527b7a","observation_id":"867aa5ff-5f4f-4dcd-b112-6c5025056ff2","resolution":{"observed_at":"2026-05-13T08:14:48.923977Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0f48ef60-ebb1-4710-ac26-4bfaa896c95c","year":2025},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:a23ff30a54c600c792cf3e9332078d1a9cdd7b88c7aca0bbed4653b76bc06c0c","observation_id":"793f5eb2-ca87-4108-8151-06de6d20d91a","resolution":{"observed_at":"2026-05-22T19:22:00.156604Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9940.370725","doi":"10.1145/3669940.3707251","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"vAttention: Dynamic Memory Management for Serving LLMs without PagedAttention,","venue":null,"work_id":"825c9c19-13d7-4b91-9c6b-8c2d1b6c90c7","year":2025},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:5f97be32e3ee4b9aef3f04ae5ca03ca1452a8a9d41a10471172c83215baa1933","observation_id":"dec2ac56-a880-43d1-946b-356688b77134","resolution":{"observed_at":"2026-05-10T02:48:26.451234Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5843.375606","doi":"10.1145/3725843.3756060","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"RayN: Ray Tracing Acceleration with Near-memory Computing","venue":null,"work_id":"a39bc5b3-593b-4a7a-9f03-f4aaf043421d","year":2025},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:43d9c6fa1087dfd416fde45686d10b58034a34602ed86d7767104e991703c42f","observation_id":"01e6bcd7-d73b-497b-a57f-430a6ba92712","resolution":{"observed_at":"2026-05-10T02:48:26.454448Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f2dba50a-98e3-449b-81a2-ddcc80797bb3","year":2011},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:6cfd1e9e4d01eb235546829952cd316ab22201db5188f752f65a9af9bee8c949","observation_id":"aafd7be7-f2d8-4ef0-bd22-6d24e65299af","resolution":{"observed_at":"2026-05-22T19:22:00.123303Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7aaee2e3-4502-48d5-9089-94b005697b03","year":2023},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:64e725a69afd6b81fbce6696b7edfffc327f7eabe4ff3dc0982118f863da8a6b","observation_id":"59189d4e-dbbd-4eff-ae6d-5c132ad8076c","resolution":{"observed_at":"2026-05-22T19:22:00.177736Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3424.36142","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grape: Practical and efficient graphed execution for dynamic deep neural networks on gpus","venue":null,"work_id":"0be9007b-a132-44b9-ae4d-08716869ee73","year":2023},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:0e3e0b158a17ce402a5ff14e69e4cfe2aa84df27ad77432f978882f940c4bf6c","observation_id":"be3ceb72-7492-41ae-b023-dbc65e57a7d6","resolution":{"observed_at":"2026-05-10T02:48:27.058151Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Accessed April 2026","venue":null,"work_id":"56b7b6f2-9122-4ce8-8c4e-d7011b931135","year":2026},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:307880d34bdcab702d7b0b0b48840395088f7e9df9b5ed84a8f3dc6a7a23aafe","observation_id":"251a5aa6-532b-4cce-95ed-26d1fc718aa6","resolution":{"observed_at":"2026-05-22T19:22:00.130260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e1125dd1-0710-4d0b-95a2-54154a9c6207","year":2024},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:c79b0056a786abd87dee0ec6993509208a668d2af5787555e08c0e88eb6e3018","observation_id":"f236e617-6e9d-4948-b24b-2bb99cb6c303","resolution":{"observed_at":"2026-05-22T19:22:00.142332Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8635d188-46f0-4702-8e77-0ed7c80e0fa4","year":2018},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:7e23326a36c277d9d07e4f52d2cc4582399cc16cc997eb81d29e1e35dcfd1d02","observation_id":"802373b7-a209-42e4-b052-e6e81f382f25","resolution":{"observed_at":"2026-05-22T19:22:00.208408Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"62275d9c-2e08-4681-9105-f8938625f21f","year":2025},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:06aab64c4d6a6d5fe5abf262b5ba08c6219875b1848e8260a8b0599ecceb4cd7","observation_id":"8d626a5b-09bc-4ed6-b148-e9878a391591","resolution":{"observed_at":"2026-05-22T19:22:00.197056Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8c2310e0-ab3b-4f63-a141-0e03506ffbb9","year":2025},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:4fb8a9de73785ecb7a7cbdccf9d4c95cd85a5b751ff2fa41080680323cc5e8c9","observation_id":"d0990dfc-0785-447b-9775-cac6128e78d7","resolution":{"observed_at":"2026-05-22T19:25:04.573575Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":"2309.17453","doi":"10.48550/arxiv.2309.17453","metadata_source":"pith","pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Efficient Streaming Language Models with Attention Sinks","venue":"cs.CL","work_id":"a8d25452-c237-48c9-88a4-682717c3979a","year":2023},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:d6dc6479f55d2511e56aec4821cc131816ba30e9d83b21230e2238b8d83a230d","observation_id":"bfbc2e60-2ebd-4fab-a5fd-63c7411d8440","resolution":{"observed_at":"2026-05-11T00:40:13.867138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6aed6440-16b3-44d0-bbfa-577f1270445b","year":2024},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:eee94a84cbda43e8e9a1aae3f6cebb851356914907d804673a436db9d587c06b","observation_id":"313561c4-ef2e-4dea-9525-bb4b9c48d236","resolution":{"observed_at":"2026-05-22T19:22:00.212369Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12702","last_updated":"2021-02-25T06:18:20Z","snapshot_observed_at":"2026-07-06T10:44:28.567802Z","submitted_at":"2021-02-25T06:18:20Z","title":"LazyFormer: Self Attention with Lazy Update","version":1},"cited_work":{"arxiv_id":"2102.12702","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.12702","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lazyformer: Self attention with lazy update, 2021 b","venue":null,"work_id":"9c2bb7d7-0ddd-4c6b-af57-4de6f5f3dd21","year":2021},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"cited_paper":"/paper/2102.12702","citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:a561aff148926eb48b1937fc02dbae88bc9d4ac9b838efecebaebf1a5e313ea7","observation_id":"8218bed6-b7a5-4a03-ba3c-2136cb234631","resolution":{"observed_at":"2026-05-10T02:48:27.062559Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.18194","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T05:09:35.700183Z","title":"arXiv:2512.18194 [cs.DC] https://arxiv.org/abs/2512.18194","venue":null,"work_id":"5add1191-397a-4b88-bf9d-0450810f89d6","year":2025},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:d5c2b8baaf153bcff453686d8fad0123c7791a5c8dd86182ad0b2a951d404d3a","observation_id":"9bee5ae2-23a3-4263-90d3-5e91ea0247a1","resolution":{"observed_at":"2026-05-10T02:48:27.060397Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9031.369608","doi":"10.1145/3689031.3696086","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":null,"venue":null,"work_id":"0eb2bb42-eec5-461c-9252-6e4a497a518e","year":2025},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:f296ba6ee01bdee5639d9b894d7d0848e2d8fa30a019e4a448e82d8f6d648609","observation_id":"22205822-6f34-413c-8064-63367be331b8","resolution":{"observed_at":"2026-05-10T02:48:26.460893Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e16a343f-86bc-4fcd-a367-fe200014d361","year":null},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:bedd97a6699d2b69531ee54e836b0c17ca6ba6905c13ed51e211400fb7c2e803","observation_id":"01a377fa-b53f-4dfe-94f0-f9ed7a7bc7b7","resolution":{"observed_at":"2026-05-22T19:22:00.145711Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18292","last_updated":"2025-03-24T02:28:04Z","snapshot_observed_at":"2026-07-06T20:57:30.357469Z","submitted_at":"2025-03-24T02:28:04Z","title":"Jenga: Effective Memory Management for Serving LLM with Heterogeneity","version":1},"cited_work":{"arxiv_id":"2503.18292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.18292","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2503.18292 (2025)","venue":null,"work_id":"eb9b8e3a-d582-4602-b928-f26613d9c2b2","year":2025},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"cited_paper":"/paper/2503.18292","citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:6371275e852fc80fd4715f9e481196a62a525c099ce29a0d13e381f5f758bf82","observation_id":"f79e7d39-93d7-4662-8af7-3c8f32826329","resolution":{"observed_at":"2026-05-10T02:48:27.083217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:79caa7dea1200ed72db8ca3389d24259023283f1ff5e2f4e3133a08babffbdbb","observation_id":"ac968331-dc79-4d57-bea6-729aa4e6c1aa","resolution":{"observed_at":"2026-05-10T20:53:19.162556Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4ca183b9-3024-4d5d-862b-0df7a26e1cea","year":2023},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:140f457e230474a1e5b77439936eb211efc6ca242cd65f2d7c1209a3232e27fd","observation_id":"430a27a3-436f-49f6-bf9f-022b8b1c1f66","resolution":{"observed_at":"2026-05-22T19:22:00.181005Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18559","last_updated":"2025-07-24T16:34:55Z","snapshot_observed_at":"2026-07-06T22:02:22.451485Z","submitted_at":"2025-07-24T16:34:55Z","title":"Optimizing Tree-structure Indexes for CXL-based Heterogeneous Memory with SINLK","version":1},"cited_work":{"arxiv_id":"2507.18559","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.18559","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8d4634f6-1105-4532-b3c8-2d3d7b6a0a72","year":2025},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"cited_paper":"/paper/2507.18559","citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:c73a48deb6e7732e106f45c6322c759d782b8297db19342cfae4e9f94f259afb","observation_id":"c71ebe57-ba35-4ff3-a9be-db911743dcbe","resolution":{"observed_at":"2026-05-10T02:48:27.091615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","latest_version":1,"primary_category":"cs.PF","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":7,"parse_uncertain":0,"unresolved":27,"verified_exact":14,"verified_fuzzy":7},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 3 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 1 inbound Pith citation observation for arXiv:2604.18529."}