{"as_of":"2026-08-09T12:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d9aa7ca9196092f680af44b704a0fd0225001e63c9d60789704cf90ff12547b9","coverage":[{"denominator":84,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":84,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T12:20:33.276786Z","state":"measured"},{"denominator":84,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":84,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05483/citation-record","integrity":"/paper/2608.05483/integrity","json":"/paper/2608.05483/citation-record.json","paper":"/paper/2608.05483"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:32.940781Z","title":"Exploiting cxl-based memory for distributed deep learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:32.940781Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:8a74f2e8d5a6de0f37f6a9a311e2c0faaa12332f31ff011fbe4d53143e8ad03f","observation_id":"69d5d327-1c51-43aa-b2e7-55961ee8f14b","resolution":{"observed_at":"2026-08-08T12:20:32.940781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:32.945642Z","title":"Arm neoverse and NVIDIA NVLink fusion: AMBA CHI C2C interoperability for custom silicon,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:32.945642Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:7166e7f01821cac3769b064abf908733dbf930397f4be975d694df0c0bebf3f6","observation_id":"ec72d40d-779e-43d4-a574-f933cd47e04b","resolution":{"observed_at":"2026-08-08T12:20:32.945642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:32.949840Z","title":"Chameleon: Versatile and practical near-dram acceleration architecture for large memory systems,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:32.949840Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:dd388c80c76c2e9bbcf2473d045a178cffe376a67b2ee961cabe9024f30d3821","observation_id":"91df20ec-a7c3-427b-87b3-7910274a157d","resolution":{"observed_at":"2026-08-08T12:20:32.949840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:32.954261Z","title":"Nvidia spent over $900 million on Enfabrica CEO, AI startup technology,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:32.954261Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:a331ca47d433e82436bb505c1d98e9d39c94540dc63c932530f5349f1e5c725a","observation_id":"6040c853-0872-4998-b5c9-bd66b582c377","resolution":{"observed_at":"2026-08-08T12:20:32.954261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.590656Z","title":"Punica: Multi-tenant lora serving,","venue":null,"work_id":"8332bca0-b279-4d6d-8494-4cde084001ca","year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:32.958486Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:f6abfc0de70cffbff109f9cbbbe3b244fcb72de87e1126fba23c3299b4854426","observation_id":"cf7ae5f9-aab4-4f54-87cb-64fafbf91ef2","resolution":{"observed_at":"2026-08-08T12:20:34.595686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.574542Z","title":"Compute express link (CXL) 3.1 specification,","venue":null,"work_id":"6f4f5a2d-5a89-4a7c-9cbf-cba49d0c48c8","year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:32.963089Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:415054ec34399121db6bdf60b3d8a3f5bf0724434ceca93725911297d922f223","observation_id":"b6d28489-d618-45aa-a872-469d226fd187","resolution":{"observed_at":"2026-08-08T12:20:34.579622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16937","last_updated":"2024-11-18T12:36:13Z","snapshot_observed_at":"2026-07-06T18:36:16.828338Z","submitted_at":"2024-06-17T09:39:34Z","title":"A Complete Survey on LLM-based AI Chatbots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16937","snapshot_observed_at":"2026-08-08T12:20:32.967888Z","title":"A complete survey on LLM-based AI chatbots,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:32.967888Z"},"links":{"cited_paper":"/paper/2406.16937","citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:60132d88fbcc03387223104ad427138bb6a56e92dbd57a2050c998a38318a792","observation_id":"c2638423-f4ad-4744-b1d8-a09cb4b1bbe7","resolution":{"observed_at":"2026-08-08T12:20:32.967888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:32.972314Z","title":"FlashAttention-2: Faster attention with better parallelism and work partitioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:32.972314Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:1717a53364e0ea58dd1c097698be38481bdf2f0210c47839ee92147981720ad1","observation_id":"be082b7b-97f9-4cf4-8b81-7d8ad4aaa47c","resolution":{"observed_at":"2026-08-08T12:20:32.972314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.549489Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness,","venue":null,"work_id":"e140408f-3d94-43ce-aaa3-c602dcfa4075","year":2022},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:32.976334Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:268250f3205e9a801445501f4f533ea9d09225e0046f5a2f8caa49b2efb95145","observation_id":"549d4585-fc73-4410-8dab-b20d04845d6c","resolution":{"observed_at":"2026-08-08T12:20:34.554629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.533780Z","title":"Qlora: Efficient finetuning of quantized llms,","venue":null,"work_id":"07b45209-e889-404f-9ece-765acdcc0764","year":2023},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:32.980323Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:34e9fec4677657cbde547daa7d46aad6ee44d1c091cd44b50c3db9f7f3a09053","observation_id":"1ec7a543-b4d5-417b-81f7-bdb3f4a5ff72","resolution":{"observed_at":"2026-08-08T12:20:34.538778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.517310Z","title":"The true processing in memory accelerator,","venue":null,"work_id":"dc8efe12-e373-4cc7-b122-9351b0efc4eb","year":2019},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:32.984353Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:26ad52e877b6b839fabb48e745a24780b4b63a936180027cfc3ec539168f2eed","observation_id":"0b17fcd5-ab90-4532-8d4c-70292885a26e","resolution":{"observed_at":"2026-08-08T12:20:34.522561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.500725Z","title":"EMFASYS: Elastic memory fabric system,","venue":null,"work_id":"eab08224-ae03-4eb9-9ed3-55caab5ee926","year":2025},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:32.988820Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:209aed23d50241b1c0caefcbc4af3752e34b1e395b6771fbf14542cc3d5872b2","observation_id":"d22943f8-9e90-455f-8ecf-2fa41249627f","resolution":{"observed_at":"2026-08-08T12:20:34.505381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.486013Z","title":"NVIDIA Grace Hopper superchip architecture in-depth,","venue":null,"work_id":"9b1f9fe0-1a7c-427b-9350-78a1fe834683","year":2022},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:32.992636Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:e3a7bec7f6d0aad9f31fe2348ed36a180c0c85e7d46b6de5332f4309ba417c4f","observation_id":"a4018afc-1ed8-4e6d-a8c9-d3e82927ba00","resolution":{"observed_at":"2026-08-08T12:20:34.490851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.470083Z","title":"Techniques for an efficient fabric attached memory,","venue":null,"work_id":"8213a398-87d0-4be3-b122-3fdea46f83e8","year":2021},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:32.996554Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:4d9e08d67f38371172ea93b92c735787dc385c1f8ecf624d5d0976d0ce1ffaac","observation_id":"1fd79946-f20b-4e20-a11f-a7cd4a611884","resolution":{"observed_at":"2026-08-08T12:20:34.475522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.454252Z","title":"Techniques for an efficient fabric attached memory,","venue":null,"work_id":"3f952f6e-0939-47c4-97d5-bfbbde4a996e","year":2023},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.000405Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:00c947efcc6a5c66650dbeda3e58e7b71e675497f3d0dfa06694292bdf87a742","observation_id":"de7a7073-e524-4e78-8b29-dec7ab493681","resolution":{"observed_at":"2026-08-08T12:20:34.458777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.439389Z","title":"Low-overhead general-purpose near- data processing in CXL memory expanders,","venue":null,"work_id":"bb0f8cb3-b56f-4458-9f31-eae052c996cb","year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.004342Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:26c3db2b968a645452d676157b9ba05ced8412cdb1aeabcea1eed23323861788","observation_id":"6a927501-7de5-428b-b7d4-d17a2429dc33","resolution":{"observed_at":"2026-08-08T12:20:34.443771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.424328Z","title":"Newton: A dram-maker’s accelerator-in- memory (aim) architecture for machine learning,","venue":null,"work_id":"f4332a25-2c89-4210-b5b3-4e6de45ea728","year":2020},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.008169Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:556e10624c7d92f6ff5a88fd2c6b5b390568bdd2412bc2caefd7ba83b976b319","observation_id":"eed5a743-8521-4670-a697-eaa604297c51","resolution":{"observed_at":"2026-08-08T12:20:34.428864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.409687Z","title":"Parameter-efficient transfer learning for nlp,","venue":null,"work_id":"201d4b8f-c713-4e55-88a6-4468e09b97cb","year":2019},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.012017Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:4dc4ebf2787c2238a0ea44b456b9e7f87d8619acdd91eee6aa9da25c0fda59a6","observation_id":"09ec8895-f7cb-45e9-bd3f-f7d10760ce01","resolution":{"observed_at":"2026-08-08T12:20:34.414123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.395364Z","title":"Latency and bandwidth impact on GPU-systems,","venue":null,"work_id":"9bdc57c1-ee59-4cbe-8066-c9aa55d2698c","year":2008},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.015668Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:2cd13fdc40497d9728a59c47c17f9e276c797395eee7ba36b50ccefec1b2b57a","observation_id":"22742911-4acb-404a-a45d-193e5d4c90b1","resolution":{"observed_at":"2026-08-08T12:20:34.400026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.020108Z","title":"LoRA: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.020108Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:5af94a38b7850bf8e7fc7f103aeca327bddf7622bab95e7b69393f18b6880cec","observation_id":"e85fc5f0-5092-4beb-b585-cbae7e8308e7","resolution":{"observed_at":"2026-08-08T12:20:33.020108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.370783Z","title":"Achieving page-mapping ftl performance at block-mapping ftl cost by hiding address translation,","venue":null,"work_id":"3e59fda8-ea02-4656-86fa-d1b1e8ebfaa9","year":2010},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.024041Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:71c5629b9d705ddc6dfb3fdd67226cab9aa3e07451e7e38658df6c85303c7080","observation_id":"3616a006-30da-4936-92bc-56eb63ef88a1","resolution":{"observed_at":"2026-08-08T12:20:34.375521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.356549Z","title":"Beacon: Scalable near-data-processing accelerators for genome analysis near memory pool with the cxl support,","venue":null,"work_id":"18c40e40-895e-4bcd-b5cf-cd4a7f494e89","year":2022},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.027918Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:c41f69114868693b81ee7d88e14ee9f27709f68e1f0aa0b20e0c5f24547b6b2e","observation_id":"a42e67e0-a5dd-4d2c-bf3a-ced8775ba74a","resolution":{"observed_at":"2026-08-08T12:20:34.361324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.341065Z","title":"Pifs-rec: Process- in-fabric-switch for large-scale recommendation system inferences,","venue":null,"work_id":"e83f8ab7-d56c-491b-9a39-49fba3bcd0a9","year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.031835Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:32c3ee1f5b1f7a0549e520848a8a2a8877afc7598bd1bbdf9bab82f0fcd65453","observation_id":"cf8c1e56-0e05-4c18-863e-8210e8fc30a9","resolution":{"observed_at":"2026-08-08T12:20:34.346166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.326179Z","title":"CXL- ANNS:Software-Hardware collaborative memory disaggregation and computation for Billion-Scale approximate nearest neighbor search,","venue":null,"work_id":"7c34dbee-00d6-4920-82af-b01f7b14f3e8","year":2023},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.035788Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:5dcba868f05b47c09937cd1244e8bfefe43de2f304375a96ed9bcade436dda7f","observation_id":"603106db-8e52-428a-ae24-61bfd7d88e38","resolution":{"observed_at":"2026-08-08T12:20:34.331209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.311959Z","title":"Demystifying a CXL type-2 device: A heterogeneous cooperative computing perspective,","venue":null,"work_id":"f5f4a381-5e1f-4af0-b6c5-5f584100477c","year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.039789Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:7ce867167f7dda8445c227e41b8273348d98ad77e4f4965fa417f188b1da4c50","observation_id":"87c81be1-a3bc-4fd6-9f5a-b51186bcc96a","resolution":{"observed_at":"2026-08-08T12:20:34.316528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.297796Z","title":"Near-memory processing in action: Accelerating personalized recommendation with AxDIMM,","venue":null,"work_id":"22751bf3-7737-4d02-9039-30df616e41a8","year":2022},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.043876Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:17003e3186231fcf37295d37a7a582bff9a4a6977d3b1f6a0b1fdc35f0de36d9","observation_id":"c4484558-365f-4596-83b0-dc321f67ef16","resolution":{"observed_at":"2026-08-08T12:20:34.301991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.284242Z","title":"Efficient memory management for large language model serving with pagedattention,","venue":null,"work_id":"cb35fbdd-e9c4-4ab9-8b5e-f346616711f8","year":2023},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.047737Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:7daf74ae62b341415bbaae9864108f03fabcbab3cd01016c544861c8a819ba16","observation_id":"5c081dc6-d69a-4784-9f6e-ca29ad58f597","resolution":{"observed_at":"2026-08-08T12:20:34.288408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.270268Z","title":"25.4 a 20nm 6GB function-in-memory DRAM, based on HBM2 with a 1.2TFLOPS programmable computing unit using bank- level parallelism, for machine learning applications,","venue":null,"work_id":"8bd7ab61-458b-4c85-9c62-bab4a7e1aae4","year":2021},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.051744Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:2f642114a47eef3d419c09493023418869b4581ae51915218f77d1bb993cfd5b","observation_id":"c1265bc4-30ea-44d6-9eb3-14dd5778eb7d","resolution":{"observed_at":"2026-08-08T12:20:34.275160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.255902Z","title":"TensorDIMM: A practical near-memory processing architecture for embeddings and tensor operations in deep learning,","venue":null,"work_id":"6e6b5b58-595c-4530-920d-fb2b69474f96","year":2019},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.055486Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:a8f0684270bbdc74aa825fe9b72da30734da85e8f1754da64fa4a8d6b7160599","observation_id":"00d9074d-7b48-4743-83e8-d4504db83dbd","resolution":{"observed_at":"2026-08-08T12:20:34.260353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.242689Z","title":"Tensor casting: Co-designing algorithm- architecture for personalized recommendation training,","venue":null,"work_id":"19bcd537-783b-43aa-b43f-5cfa86d033eb","year":2021},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.059021Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:e3b21c946d01d18c1aebd333e12af03af5ebf59f859976d05ae3a865487f487c","observation_id":"dbead095-a5e6-4a04-ac99-2ff2af513e90","resolution":{"observed_at":"2026-08-08T12:20:34.246975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.229186Z","title":"A 1ynm 1.25v 8gb, 16gb/s/pin gddr6-based accelerator- in-memory supporting 1tflops mac operation and various activation functions for deep-learning applications,","venue":null,"work_id":"a32f9faf-021f-44bc-9074-ea71d707b597","year":2022},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.062588Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:f2837809534c59d02153dfcb746125580898dcdba6687fe54930064eb7a9128c","observation_id":"eca4a8b5-00f1-4406-adcb-73789c572852","resolution":{"observed_at":"2026-08-08T12:20:34.233422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.216486Z","title":"Hardware architecture and software stack for PIM based on commercial DRAM technology: Industrial product,","venue":null,"work_id":"a072a2dd-c88b-4d1f-99c6-ab213d759c83","year":2021},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.066232Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:fe83e65e84530bfe4509900c6d7b8756f04f6d3067e67d34b5ff4579d43e7f56","observation_id":"6545275e-dcd4-4aa5-8c09-53d6b16eff9a","resolution":{"observed_at":"2026-08-08T12:20:34.220462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.202794Z","title":"Evaluating modern GPU interconnect: PCIe, NVLink, NV- SLI, NVSwitch and GPUDirect,","venue":null,"work_id":"fd694f7c-9c7e-4a8d-a6e8-71c8c1cd0ff0","year":2020},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.069807Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:195b9183b0415cd907230fd34d0f82e4cabfc709e50e42e174b4301e3cb4609b","observation_id":"e264a6ff-77c1-4c47-ab56-446455acbc6b","resolution":{"observed_at":"2026-08-08T12:20:34.207615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.187928Z","title":"Pond: CXL-based memory pooling systems for cloud platforms,","venue":null,"work_id":"532debd6-4c50-4aed-ba07-4ea34a75e3e5","year":2023},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.073545Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:661d258c0d97df65e1d08e8774bfd14b44cc20dab21d8530052e8ee928353bde","observation_id":"e741aee0-a685-4f02-a73b-0f206e053179","resolution":{"observed_at":"2026-08-08T12:20:34.192748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11240","last_updated":"2024-01-20T14:37:48Z","snapshot_observed_at":"2026-07-06T17:18:16.042313Z","submitted_at":"2024-01-20T14:37:48Z","title":"CaraServe: CPU-Assisted and Rank-Aware LoRA Serving for Generative LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11240","snapshot_observed_at":"2026-08-08T12:20:33.077193Z","title":"CaraServe: CPU-assisted and rank-aware LoRA serving for generative LLM inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.077193Z"},"links":{"cited_paper":"/paper/2401.11240","citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:f57721f067fe6d5def7a10a4158be966f8e6a920f423db26c72d599f85d39fa2","observation_id":"60d133cf-caeb-4cbc-9a60-cdddbcbacc21","resolution":{"observed_at":"2026-08-08T12:20:33.077193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.172913Z","title":"Prefix-tuning: Optimizing continuous prompts for generation,","venue":null,"work_id":"b6365c28-2e72-45ea-9e96-3656ab461a30","year":2021},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.081343Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:b1c5d7bf321e05d6636b49c25afc4dfbbdd8637bb736f77727767d6d8c0e8a77","observation_id":"8ef50a4e-316d-410a-856a-5dd7ebdebc21","resolution":{"observed_at":"2026-08-08T12:20:34.177710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.157562Z","title":"Disaggregated memory for expansion and sharing in blade servers,","venue":null,"work_id":"cf6e6905-1cb8-4111-b760-8c981baf9d81","year":2009},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.084834Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:d0c0f97f825b2bb028439e6ca0059c12df516a3d24dd0507cc7e64600a62444a","observation_id":"d6d8838d-a5bb-424e-8d1b-fc5d791d6fa9","resolution":{"observed_at":"2026-08-08T12:20:34.163136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.141474Z","title":"Enabling efficient large recommendation model training with near cxl memory processing,","venue":null,"work_id":"f72a9a00-f4b0-4475-8c30-64a1d32d8726","year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.088629Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:5d3e8496e431452646adab46401b5ba3db1294da37a1fd9e1a69e61e16ff1fa9","observation_id":"4ffefbb9-a924-487c-bd9a-e81df163b784","resolution":{"observed_at":"2026-08-08T12:20:34.146719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.126661Z","title":"Make LLM inference affordable to everyone: Augmenting GPU memory with NDP-DIMM,","venue":null,"work_id":"fe29eb0e-957e-4acd-bdb2-dd88e014784b","year":2025},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.092440Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:0b9ad60f26e98fceba37ad663c0d3fd53afa1167db1e84e7ae78c882b4503344","observation_id":"347e8d3c-13c8-4fe8-9a7e-61b9f87035cb","resolution":{"observed_at":"2026-08-08T12:20:34.131485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T12:20:33.096095Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.096095Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:c62c82225f4b595979e96cac9cd1008481e9b5e64a2ca4cf6f6bc74ccef288fb","observation_id":"36dd16d6-4c5a-49ed-8a42-cb92310fcd23","resolution":{"observed_at":"2026-08-08T12:20:33.096095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.110167Z","title":"LLaMAX: Scaling linguistic horizons of LLM by enhancing translation capabilities beyond 100 languages,","venue":null,"work_id":"658d2f50-40d0-4090-9210-00cb511d8a05","year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.100034Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:65e3c009d482dc1ca6b56d0755c286ae704b2892f3142eb9640579eb530d56a6","observation_id":"62cf7a44-592b-4eb0-b95b-2f84b28d772c","resolution":{"observed_at":"2026-08-08T12:20:34.115705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.094641Z","title":"PEFT: State-of-the-art parameter-efficient fine-tuning methods,","venue":null,"work_id":"de957372-9251-4736-a9cb-0da36c43ae73","year":2022},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.103859Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:ae2e3d5b3e25b42da01043ed3fdbffb3738bd735834c0ee0dd33804265f9c261","observation_id":"62eca269-efd8-45ca-a267-d14d13fef162","resolution":{"observed_at":"2026-08-08T12:20:34.099912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:34.037396Z","title":"SiFive bakes NVIDIA’s NVLink fusion into its RISC-V CPU IP,","venue":null,"work_id":"024f5dff-3530-46e6-8e18-0424cd1c740d","year":2026},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.107529Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:849433b676fb6402c245959f166089cb978cbdf1805c56a0f0edade8ad55147b","observation_id":"b5618d45-e855-46a2-85eb-827313a7cf5d","resolution":{"observed_at":"2026-08-08T12:20:34.065572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.997701Z","title":"Tpp: Transparent page placement for cxl-enabled tiered-memory,","venue":null,"work_id":"fbfda2ed-556b-4f5d-8602-daa6e700376e","year":2023},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.111582Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:a30206b30454ce666b0d90a75832ca66108ade2b78e9d151f7e5535e8284fdde","observation_id":"18542b4f-e8c7-4556-860c-3ea974fca217","resolution":{"observed_at":"2026-08-08T12:20:34.011878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.969789Z","title":"Marvell introduces breakthrough Structera CXL product line to address server memory bandwidth and capacity challenges in cloud data centers,","venue":null,"work_id":"df0616a7-94a7-4896-b3fa-95fd2552933a","year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.115322Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:169a58e6179a195df429766d75f70f80d580762de58c87b0a17c47a72a4f9693","observation_id":"d86235cc-866b-4886-b8b3-5a2f40470676","resolution":{"observed_at":"2026-08-08T12:20:33.979110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.950920Z","title":"Specinfer: Accelerating large language model serv- ing with tree-based speculative inference and verification,","venue":null,"work_id":"22dd4737-4f83-4bed-961b-b2ecc7e134ae","year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.119339Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:c4e8300e7b93ceff2a0ca4e7fa11c5440c5fc6e7c13501ede215c1b32a48e024","observation_id":"615b1e46-b7d1-4296-81e4-5101c9121aa3","resolution":{"observed_at":"2026-08-08T12:20:33.958050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.936468Z","title":"Micron launches memory expansion module portfolio to accelerate CXL 2.0 adoption,","venue":null,"work_id":"67ac794c-48bb-4848-9d66-86b0445d5f77","year":2023},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.123307Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:36e55c120968e26248d3e68d71dfbe782eded4b88210244e59c3d6beba428dc6","observation_id":"0e5d50dd-e7e7-456a-b32a-08a12cd1e454","resolution":{"observed_at":"2026-08-08T12:20:33.941089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.915511Z","title":"Nvidia licenses NVLink memory ports to CPU and accelerator makers,","venue":null,"work_id":"ae7ad052-a153-42cc-adca-aeae759122a2","year":2025},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.127195Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:6b293741d241216b4cb6daeb7974c68f3ef4b230fa367a1fb0fd86c54919e083","observation_id":"fee3e2c8-27f6-4956-bf35-a72e7b29a6c7","resolution":{"observed_at":"2026-08-08T12:20:33.925238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.130901Z","title":"Using an llm to help with code understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.130901Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:18917cb2dbfc023480b11cb6079d52bcc868f48a6aeb70e1359038461a5ef2a6","observation_id":"34036524-fbd9-43c8-8821-9108f983752e","resolution":{"observed_at":"2026-08-08T12:20:33.130901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.884263Z","title":"Understanding pcie performance for end host networking,","venue":null,"work_id":"8d240420-c8de-4e84-857d-72bb611219a0","year":2018},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.135208Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:024fba3001cf0b13df5118aa6b30cc9a76d2f96d1c76b85ab5f3b9bd1ea27edc","observation_id":"a18e6e79-f6ff-4149-a6c7-621212ebc081","resolution":{"observed_at":"2026-08-08T12:20:33.891676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.868295Z","title":"NVIDIA A100 Tensor Core GPU Archi- tecture,","venue":null,"work_id":"eaec2988-5f94-48a8-9baf-3c6a43183b3f","year":2020},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.139202Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:bf772e2396200a9d6168b46692f6d8b8b157a785acdc0215af555df3b7e1fc88","observation_id":"bb34a211-d656-430f-bb51-baa45980a68a","resolution":{"observed_at":"2026-08-08T12:20:33.873169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.851367Z","title":"NVIDIA H100 Tensor Core GPU Architecture,","venue":null,"work_id":"f1191fe8-7682-4947-a36a-64a131f549ac","year":2023},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.143668Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:1a10cdea47db0a4dea5475f52eb3bac0f36ea86522184c617ff7504d452467ca","observation_id":"023d15a2-8f36-47e2-91e6-0102727b2a7f","resolution":{"observed_at":"2026-08-08T12:20:33.856858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.836860Z","title":"NVIDIA unveils NVLink fusion for industry to build semi-custom AI infrastructure with NVIDIA partner ecosystem,","venue":null,"work_id":"151c6fb2-ff91-4710-9232-6cb7b19f30f7","year":2025},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.147807Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:d9c038533f647627ee1cc08752d7310a3bc6981062fb067d777b67a0dc694d1c","observation_id":"65df5acb-b8f0-4302-8de1-f240d2fc1488","resolution":{"observed_at":"2026-08-08T12:20:33.841798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.822188Z","title":"Extended GPU memory,","venue":null,"work_id":"66ade677-4d20-4ea0-a90f-674039ced2d1","year":2026},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.152193Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:2dfe713f2ee7765bd769769a5ded2b68a786196b34412067401986d952774405","observation_id":"f7b87e51-933d-474a-bbba-9fab2e07bccb","resolution":{"observed_at":"2026-08-08T12:20:33.827502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.808159Z","title":"NVLink-C2C: Chip interconnect technology,","venue":null,"work_id":"f1dcfcba-5497-40a9-af50-97cab53f230e","year":2026},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.156541Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:0739a4c4df84ec6a5c2ec84a46cf5b9d2169bf5975b0662eca1822f09966173d","observation_id":"93ac9855-2b9e-4d34-ab4f-f830ec7374ad","resolution":{"observed_at":"2026-08-08T12:20:33.812443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.793726Z","title":"NVLink: The scale-up network for AI factories,","venue":null,"work_id":"0ee07d10-70c4-4763-b3b2-a3110c4cdcf0","year":2026},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.160514Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:b7176de7769218e8e134ede1c4e59e86e7be842d38b0ef00fa3f470ca044b4cd","observation_id":"ea828bc0-abbb-44b4-9b5c-7ce9a90578fa","resolution":{"observed_at":"2026-08-08T12:20:33.798540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T12:20:33.164550Z","title":"GPT-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.164550Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:e7a736bdd80407c2324dedbbd7ce33babd45d923ed46402c222acb69cb4fa48c","observation_id":"37772516-2d86-4f4a-be92-45fe20ade695","resolution":{"observed_at":"2026-08-08T12:20:33.164550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.778794Z","title":"Attacc! unleashing the power of pim for batched transformer- based generative model inference,","venue":null,"work_id":"41ebda7a-5c64-4d94-85f7-d8e4c2ac5212","year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.168658Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:7cf543d1ca58d823658b5bf597a1ffbdd44953be0f67fbb143c663a344532b10","observation_id":"89914902-774f-440e-ba6a-81f29c951446","resolution":{"observed_at":"2026-08-08T12:20:33.783222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.763903Z","title":"Trim: Enhancing processor-memory interfaces with scalable tensor reduction in memory,","venue":null,"work_id":"f51d5a5e-6b7f-43ee-aea3-257f3b08b098","year":2021},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.172635Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:7296d6a53f52cf4acaa17daf6545899cf58eb24be810c44af15182e29bc4835d","observation_id":"16ead26d-fcc7-4674-b0aa-c35531f3fcb3","resolution":{"observed_at":"2026-08-08T12:20:33.768997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.749105Z","title":"An LPDDR-based CXL-PNM platform for TCO-efficient inference of transformer-based large language models,","venue":null,"work_id":"bd7f3505-9528-4cd3-ae2f-0d8bb1de89b0","year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.177062Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:3bcf5679dd6cf5c584a3a49e15ca681195e8453757ee3475827ae30bb653584b","observation_id":"421507d8-8832-4f9f-b084-7326cc4b1248","resolution":{"observed_at":"2026-08-08T12:20:33.754061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.734407Z","title":"System optimization of data analytics platforms using compute express link (CXL) memory,","venue":null,"work_id":"bdf8c9aa-b59e-47ba-a7bf-00208367e5ac","year":2023},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.181093Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:0bd3641eb75b057a28f57b3e7e4b14674c4dad07aa85e7958f808e49b40db2bd","observation_id":"7b524d22-1bff-4130-a21e-a660c63023db","resolution":{"observed_at":"2026-08-08T12:20:33.738800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.710823Z","title":"Samsung CXL solutions: CMM-H (CXL memory module – hybrid),","venue":null,"work_id":"7e86bc5a-b76e-4603-ab2d-a8effc66ebb3","year":null},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.185053Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:987f9947c20edc61eeead83133ca1793835c08536806992c6c42912b4dc718d9","observation_id":"714db274-4749-48b0-926c-472b1b40c875","resolution":{"observed_at":"2026-08-08T12:20:33.724966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.662033Z","title":"Flashattention-3: Fast and accurate attention with asynchrony and low- precision,","venue":null,"work_id":"ff2e885e-a80e-4bdd-b087-ef38b3f3b680","year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.193724Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:b2f21092a6cda14ea31a86ffde8cab03a6f3b13753430066df9b314b3438cf42","observation_id":"7f7d6d72-7bf6-4290-9b39-d252786c12ac","resolution":{"observed_at":"2026-08-08T12:20:33.669240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.643083Z","title":"Pci express® 6.0 specification at 64.0 gt/s with pam- 4 signaling: a low latency, high bandwidth, high reliability and cost- effective interconnect,","venue":null,"work_id":"0613da63-410d-4971-abca-c676793196a1","year":2020},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.197983Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:c00a893b8a8ea77f9b1718462cb9aca7c36b405de3db9587462c2fedcb5685be","observation_id":"26fd3423-b93e-4e2c-8902-2e5e32978542","resolution":{"observed_at":"2026-08-08T12:20:33.649764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.626544Z","title":"S-LoRA: Serving thousands of concurrent LoRA adapters,","venue":null,"work_id":"9d03d436-72f4-4cb8-bc1c-77ee2a4b707d","year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.201907Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:3bfacca2532e8dbb26f4b00ffa29aff35a6de12a0cb631a7af774d3b8e47db3f","observation_id":"6f287182-2079-498a-a837-c5cfdaa79027","resolution":{"observed_at":"2026-08-08T12:20:33.631792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.610975Z","title":"Flexgen: High-throughput generative inference of large language models with a single gpu,","venue":null,"work_id":"9b9039a5-3a99-476c-abb6-665f1a8ea3b0","year":2023},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.205753Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:29c26fd432ccc5a7cde22a7dd40d10d459ab62201a30f2e9abb31a0e1982074c","observation_id":"c2db919a-02dd-485c-bd2c-4c5b9a6963b8","resolution":{"observed_at":"2026-08-08T12:20:33.615867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.595425Z","title":"NVIDIA announces NVLink fusion: Bringing NVLink to third-party CPUs and accelerators,","venue":null,"work_id":"728d2ed9-45c7-4d32-8315-665694899c15","year":2025},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.209938Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:3a0f44540536a33acacba95a4d52067112c3f89f1f196fac2322e5a1857b7e85","observation_id":"e962fbe3-bb83-4e95-821d-d784465916ce","resolution":{"observed_at":"2026-08-08T12:20:33.600341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.580975Z","title":"Demysti- fying CXL memory with genuine CXL-ready systems and devices,","venue":null,"work_id":"e1b0ff04-4daf-4375-91ad-ce028ca6ded2","year":2023},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.214124Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:bd964e839a84c994f4cd3334c4aa2642b7f230cfa1f2421ecbb2343836e382dd","observation_id":"06ac0306-38c1-4bac-9d86-33e22411884e","resolution":{"observed_at":"2026-08-08T12:20:33.585491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.566450Z","title":"NVIDIA’s NVLink fusion stays proprietary, third parties can only work around it,","venue":null,"work_id":"71de2898-3438-42c7-a3ee-c304826c2e06","year":2025},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.218273Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:07ad94534e124048c4a5785e076fb63958cb591553da84c8f18d388e5b44ec37","observation_id":"be69a7b1-3993-4468-8b85-b2dfe10148ae","resolution":{"observed_at":"2026-08-08T12:20:33.571469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-08T12:20:33.222028Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.222028Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:7319267b63e78190940e5fb866e54250849f2a6806d734f31110fd9a2b9490c1","observation_id":"bba8b162-dc34-4b8a-863a-daefb14c5461","resolution":{"observed_at":"2026-08-08T12:20:33.222028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.550714Z","title":"Introducing UALink 200g 1.0 specification,","venue":null,"work_id":"9568b44b-c4c4-49be-8788-63d1f68fcf33","year":2025},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.226083Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:7e89bdec3c505d8e3afbd452607268b32b8cc450d43ccc41a36b6b0ad09cda5f","observation_id":"de0703f1-8098-405e-87f4-b4059b6dbeac","resolution":{"observed_at":"2026-08-08T12:20:33.555910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.536348Z","title":"RAG-based LLM chatbot using Llama-2,","venue":null,"work_id":"438296b9-91b0-49c6-a39f-6495d42ab2ad","year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.229877Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:8a75cd99e529beda8f701a2a44021ac4ed8e48318d5e4f2e6b28185a0d982557","observation_id":"77e29f3c-d11b-40bd-b72d-bcd1d63c4241","resolution":{"observed_at":"2026-08-08T12:20:33.540781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.233661Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.233661Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:1f87a6b9e2d7b2c6e8a0da99639be73172f15bbf096df212cee08a518a02b7e4","observation_id":"575ba757-7920-4f94-a221-c16d6aadc94d","resolution":{"observed_at":"2026-08-08T12:20:33.233661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.509742Z","title":"CodeT5: Identifier-aware unified pre-trained encoder-decoder models for code understanding and generation,","venue":null,"work_id":"75496e9b-8e3d-4cfc-a60e-11cf6410da05","year":2021},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.237540Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:f4f9f0b131857a235db9e36ecdf81c7779046dbb96ea6760f72ba7a9997c2e39","observation_id":"23d86cb9-f84e-41ac-bba5-004e4e5e0757","resolution":{"observed_at":"2026-08-08T12:20:33.514676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.494414Z","title":"Towards memory disaggregation via NVLink C2C: Benchmarking CPU-requested GPU memory access,","venue":null,"work_id":"440ddfb4-cdcd-499d-acf7-3ef2e0d64af4","year":2025},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.241635Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:ac57786513f62d01abbba76ae46a1dd195c82dcad2495731ccd3b80a9725da5b","observation_id":"3ba0a593-5564-47de-b4e4-7e5ccfd899c7","resolution":{"observed_at":"2026-08-08T12:20:33.499655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.479763Z","title":"dLoRA: Dynami- cally orchestrating requests and adapters for LoRALLM serving,","venue":null,"work_id":"8ff3ff20-3c87-475c-a730-55c666bd771b","year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.245554Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:9b162a53822c385ca090d8c2f83fc8ebf7e9b2ca17132ec5ba184cca23eba2cd","observation_id":"1546ed30-3624-4b56-89b0-ee37b2cf26a3","resolution":{"observed_at":"2026-08-08T12:20:33.484647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.465709Z","title":"Overcoming the memory wall with CXL- EnabledSSDs,","venue":null,"work_id":"102c557e-8352-4f2d-81e5-345009c4d516","year":2023},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.249303Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:6f3cab635b3c9ae533d3b35d96b817baf58f87d0425aa5418970796197b748f4","observation_id":"3a8b3a48-e8bc-44d1-becf-abaf1122fe09","resolution":{"observed_at":"2026-08-08T12:20:33.470176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.450959Z","title":"Orca: A distributed serving system for Transformer-Based generative models,","venue":null,"work_id":"33c2628c-bc46-47d1-9ba6-41977a302de6","year":2022},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.253214Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:fb3f27a41b62156ef14837738b9617ae76fdefa0a3f59ca58e47574b5ea5098e","observation_id":"960e80d9-f6f7-4127-a171-cea507e390c1","resolution":{"observed_at":"2026-08-08T12:20:33.455342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.265097Z","title":"SGLang: Efficient execution of structured language model programs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.265097Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:20d908226d37e925b6ae01fb017cf928fcb753adb150eff066544c2324b33b5c","observation_id":"8093c004-5ed9-452e-95d6-a765fd4b8ccd","resolution":{"observed_at":"2026-08-08T12:20:33.265097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.428368Z","title":"DistServe: Disaggregating prefill and decoding for goodput- optimized large language model serving,","venue":null,"work_id":"9cec0990-e04f-496e-a587-af11aadb1cd1","year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.269028Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:4acb68d469622b8e49fa8d96d1d13bd61f6bd3dd47131b238d3110bd891e8ae6","observation_id":"cdd4b648-11f9-4093-a2db-1c85884fbc89","resolution":{"observed_at":"2026-08-08T12:20:33.432764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.414374Z","title":"Remap-SSD: Safely and efficiently exploiting SSD address remapping to eliminate duplicate writes,","venue":null,"work_id":"4763b6fb-ca5e-4baf-adbb-c5cfb072bd0b","year":2021},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.272989Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:8535b227f6f895caabbfe802dd7b77083582c40b347ccada78bafcaf62d718d6","observation_id":"1d2fd4d4-375a-4ec2-ab5a-989143d79c13","resolution":{"observed_at":"2026-08-08T12:20:33.418903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.397273Z","title":"NeoMem: Hardware/software co- design for CXL-native memory tiering,","venue":null,"work_id":"d1dc771e-7ac1-4cf4-b777-2778bf96e7f7","year":2024},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.276786Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:6651b4e417406f963c980aaedf93215f6f86d21817bad6280069f5f7a001406d","observation_id":"1859044a-ba1b-4bd1-b1f5-24b53dd0e992","resolution":{"observed_at":"2026-08-08T12:20:33.403267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:20:33.682963Z","title":"Available: https://semiconductor.samsung.com/news- events/tech-blog/samsung-cxl-solutions-cmm-h/","venue":null,"work_id":"89555c88-360a-4d36-a002-fc70d90f7547","year":null},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.189443Z"},"links":{"citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:cfd5e44673772b0b07cd22009d0b94d2cd97fa7836011daaaf8c200461258c75","observation_id":"75041bd3-741f-4775-9240-522b8c324162","resolution":{"observed_at":"2026-08-08T12:20:33.694035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22017","last_updated":"2025-03-27T22:16:57Z","snapshot_observed_at":"2026-08-07T20:40:26.330547Z","submitted_at":"2025-03-27T22:16:57Z","title":"Performance Characterizations and Usage Guidelines of Samsung CXL Memory Module Hybrid Prototype","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22017","snapshot_observed_at":"2026-08-08T12:20:33.261299Z","title":"Available: https://arxiv.org/abs/2503.22017","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:33.261299Z"},"links":{"cited_paper":"/paper/2503.22017","citing_paper":"/paper/2608.05483"},"observation_digest":"sha256:7db94131f5cac7fda8c98aee6e7727241f3802873b2c21ef00de0b3a6a0d7065","observation_id":"456926f1-a6f7-4ff2-a75d-4ae099b1492b","resolution":{"observed_at":"2026-08-08T12:20:33.261299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.05483","last_updated":"2026-08-06T00:19:56Z","latest_version":1,"primary_category":"cs.AR","snapshot_observed_at":"2026-08-09T12:12:48.904748Z","submitted_at":"2026-08-06T00:19:56Z","title":"PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving"},"reference_resolution":{"displayed":84,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":69},"total_outbound_references":84},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 84 of 84 outbound references and 0 inbound Pith citation observations for arXiv:2608.05483."}