{"as_of":"2026-08-08T11:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6b7bb595cd0f8639dc77f29b01a60fbc0b3681d4c1c5ac536a67491078723e55","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:58:07.427165Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T13:52:43.151100Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"cited_work":{"arxiv_id":"2505.23072","doi":"10.48550/arxiv.2505.23072","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23072","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025 , eprint =","venue":"ArXiv.org","work_id":"727627f2-2663-46ce-897e-67bfd30b6a96","year":2025},"citing_paper":{"arxiv_id":"2605.29639","last_updated":"2026-05-28T09:07:06Z","snapshot_observed_at":"2026-08-03T07:14:27.185639Z","submitted_at":"2026-05-28T09:07:06Z","title":"RTP-LLM: High-Performance Alibaba LLM Inference Engine","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-28T23:52:40.763228Z"},"links":{"cited_paper":"/paper/2505.23072","citing_paper":"/paper/2605.29639"},"observation_digest":"sha256:aa7b5acc5b1dfeec978d62ef387433b23b8b13f4f90a4b2496b6cf9d2344bf53","observation_id":"42ecb65a-73c0-4442-bca7-7388a2662378","resolution":{"observed_at":"2026-06-28T23:52:49.146323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"cited_work":{"arxiv_id":"2505.23072","doi":"10.48550/arxiv.2505.23072","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23072","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025 , eprint =","venue":"ArXiv.org","work_id":"727627f2-2663-46ce-897e-67bfd30b6a96","year":2025},"citing_paper":{"arxiv_id":"2606.23969","last_updated":"2026-07-09T21:35:14Z","snapshot_observed_at":"2026-08-08T06:46:09.840905Z","submitted_at":"2026-06-22T21:48:53Z","title":"The Serialized Bridge: Understanding and Recovering LLM Serving Performance under Blackwell GPU Confidential Computing","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-26T06:39:04.161585Z"},"links":{"cited_paper":"/paper/2505.23072","citing_paper":"/paper/2606.23969"},"observation_digest":"sha256:48ac8d834f4cf6380b9ef7de9dec8c1effbe54f20daf7f3c55b6a6291d36d3e3","observation_id":"7d5d1c20-ccf9-4905-a4bf-701289fb01aa","resolution":{"observed_at":"2026-06-26T22:10:09.429560Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23072","snapshot_observed_at":"2026-07-13T07:20:36.786149Z","title":"Jianwei Zhu, Hang Yin, Peng Deng, Aline Almeida, and Shunfan Zhou","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23969","last_updated":"2026-07-09T21:35:14Z","snapshot_observed_at":"2026-08-08T06:46:09.840905Z","submitted_at":"2026-06-22T21:48:53Z","title":"The Serialized Bridge: Understanding and Recovering LLM Serving Performance under Blackwell GPU Confidential Computing","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T07:20:36.786149Z"},"links":{"cited_paper":"/paper/2505.23072","citing_paper":"/paper/2606.23969"},"observation_digest":"sha256:93d0038d050d82fc40b097199b3a135f052bdd685b61e252dc316d3133bcbd3f","observation_id":"c7989ea8-90ee-4b21-9d22-1c174033d54c","resolution":{"observed_at":"2026-07-13T07:20:36.786149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23072","snapshot_observed_at":"2026-08-01T13:52:43.151100Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18957","last_updated":"2026-07-21T10:49:12Z","snapshot_observed_at":"2026-08-07T06:53:59.829526Z","submitted_at":"2026-07-21T10:49:12Z","title":"InstantInfer: Enabling Fast LLM Cold Start with Communicating Finite Automata","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T13:52:43.151100Z"},"links":{"cited_paper":"/paper/2505.23072","citing_paper":"/paper/2607.18957"},"observation_digest":"sha256:f40eb2f65ce97722a06166c63cea596c65095e10641514fd16354c3730d2824a","observation_id":"28bcb40f-0c63-43a1-96ad-41b4b97a7e89","resolution":{"observed_at":"2026-08-01T13:52:43.151100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23072/citation-record","integrity":"/paper/2505.23072/integrity","json":"/paper/2505.23072/citation-record.json","paper":"/paper/2505.23072"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:12.580330Z","title":"Introducing ChatGPT,","venue":null,"work_id":"976ff8b7-0ed0-4938-94a8-7a304407a374","year":2022},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:03.832875Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:f4299e856e1ce9a5b3ffbaebdb46d2bd0302d1d12f742bad2a8fb4431965b0e9","observation_id":"1eb807ef-31d1-4c1d-9bdf-4ecf60c58ed7","resolution":{"observed_at":"2026-08-07T12:58:12.656524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:12.445696Z","title":"Introducing Gemini: our largest and most capable AI model,","venue":null,"work_id":"b4f4c401-0101-4a0b-8998-ea730707e47d","year":2023},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:03.902873Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:ce9e9b821c70515f39d1b580173ee922f7b9c81766713fa628e89db4f93bd404","observation_id":"f5b86204-bff4-4e3f-ac2b-9f89a0b3f10e","resolution":{"observed_at":"2026-08-07T12:58:12.492922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:12.291649Z","title":"Granite Code Models: A Family of Open Foundation Models for Code Intelligence,","venue":null,"work_id":"e32d11b2-73e0-48ff-81d1-44dd78bedbe0","year":null},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:03.973943Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:412839a1e8e88da69cc0d2fedd27732b2fb3230576c6fd2107f6ed08e9a55790","observation_id":"9a68980f-964e-44a0-9507-846aeffe203f","resolution":{"observed_at":"2026-08-07T12:58:12.366624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:12.133669Z","title":"The Shift from Models to Compound AI Systems,","venue":null,"work_id":"03954e49-4cfd-435c-a06b-060d7be1e7fd","year":2024},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:04.077312Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:422389401a05a12a9f72be9308e97f56949ffcb7cb86af1d16ba2fde2a177296","observation_id":"25defce5-5c40-4fd9-a40e-73806d7154ac","resolution":{"observed_at":"2026-08-07T12:58:12.176639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:11.949048Z","title":"FlashAttention: Fast and memory-efficient exact attention with IO-awareness,","venue":null,"work_id":"b7551d52-6299-4c91-a02f-f3eb5ba76617","year":2022},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:04.145099Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:f64b9c839991832e650b514c325ab385bb406d7cb16b896f80e9656605fd6f24","observation_id":"87dc08d5-980d-4bd8-b7d9-83a130d7e7d3","resolution":{"observed_at":"2026-08-07T12:58:12.059280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:11.821852Z","title":"FlashAttention-2: Faster attention with better parallelism and work partitioning,","venue":null,"work_id":"00d56ddf-a0d0-40e3-a24b-a8633cba1ba9","year":2024},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:04.214691Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:a7af91db532e15903c695986c64be07da7f711579cd5e119d22d7509ea0886ef","observation_id":"fd73d497-5dc8-42c4-9eb6-1b2a8d87bdc7","resolution":{"observed_at":"2026-08-07T12:58:11.895787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:11.720802Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention,","venue":null,"work_id":"e482cd0f-2755-4abb-b4ee-dbd2b2593259","year":2023},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:04.304079Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:b1b0a3044c604f55b116cb6f769a712fb3def25f0bd5df250f515905ccca6bd1","observation_id":"12cc850f-9c15-4005-87b1-9ae7c7d25ae2","resolution":{"observed_at":"2026-08-07T12:58:11.758834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:11.536060Z","title":"Orca: A Distributed Serving System for Transformer-Based Generative Models,","venue":null,"work_id":"449c1a70-9a50-4a92-a77f-c35ce0fede12","year":2022},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:04.350083Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:aee03da95c77f792fd95a78ccb9339fd80ed482afd53cab00b9d9505cc5680b8","observation_id":"ae9808a8-4a8a-421d-9b8b-1cd773232cd5","resolution":{"observed_at":"2026-08-07T12:58:11.611414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19124","last_updated":"2024-06-06T18:38:34Z","snapshot_observed_at":"2026-07-06T18:07:23.217029Z","submitted_at":"2024-04-29T21:59:07Z","title":"Accelerating Production LLMs with Combined Token/Embedding Speculators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19124","snapshot_observed_at":"2026-08-07T12:58:04.425862Z","title":"Accelerating Production LLMs with Combined Token/Embedding Speculators,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:04.425862Z"},"links":{"cited_paper":"/paper/2404.19124","citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:fc4174164d1b611c5b9f0c5c24b4d31f06d408db9612560a50a85448f7c3590b","observation_id":"e30d29f1-ab5e-4cdb-9cc2-d96cb0e427d8","resolution":{"observed_at":"2026-08-07T12:58:04.425862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09670","last_updated":"2024-06-06T15:50:51Z","snapshot_observed_at":"2026-08-05T00:28:57.370523Z","submitted_at":"2024-01-18T01:03:38Z","title":"DistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09670","snapshot_observed_at":"2026-08-07T12:58:04.496281Z","title":"DistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:04.496281Z"},"links":{"cited_paper":"/paper/2401.09670","citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:852a159a11a4658f888d66f6200826eaf23a4be9cd991b1e322567327f9c1d35","observation_id":"e64cecdc-7e37-422b-9e32-862ec995d3f4","resolution":{"observed_at":"2026-08-07T12:58:04.496281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:11.383480Z","title":"Taming throughput-latency tradeoff in llm inference with sarathi-serve,","venue":null,"work_id":"a7033e91-447b-4b82-a15e-bdf7349365a8","year":2024},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:04.561087Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:8964457bc21cf3f6e167b5e060434c098e88bc040fe52359b057d7921ac3f9f7","observation_id":"c2718510-a082-46bb-aa53-00fac5a49f0d","resolution":{"observed_at":"2026-08-07T12:58:11.472887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:11.237124Z","title":"Decrease PyTorch Model Load Times with CoreWeave’s Tensorizer,","venue":null,"work_id":"e9fd326a-47a4-42e8-aea5-b3352a472860","year":2024},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:04.639769Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:3a71ab8f279b9b4f10bedda237b3a9481303b91b5829b560ef644800686d321d","observation_id":"910f4ac6-e5ae-4023-9856-08bdf6a695fc","resolution":{"observed_at":"2026-08-07T12:58:11.309831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14351","last_updated":"2024-07-25T08:08:11Z","snapshot_observed_at":"2026-08-05T17:30:19.943478Z","submitted_at":"2024-01-25T17:55:07Z","title":"ServerlessLLM: Low-Latency Serverless Inference for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14351","snapshot_observed_at":"2026-08-07T12:58:04.729125Z","title":"ServerlessLLM: Locality-Enhanced Serverless Inference for Large Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:04.729125Z"},"links":{"cited_paper":"/paper/2401.14351","citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:52b604b399b3e0144ea1db16f72eaa42c0eae0da00d58c64dbf8a89a57c9a2aa","observation_id":"cda45ea4-2e7e-4ab7-952f-e4009f79e25f","resolution":{"observed_at":"2026-08-07T12:58:04.729125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-08T01:15:17.906950Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-07T12:58:04.791744Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:04.791744Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:43bc62804ea4cacc4b6f14b124542d2de88fd108a900d37b8c98b0f2f7bca9b3","observation_id":"2b1adefe-1e6a-4e8c-8fe1-fb2f309c00e3","resolution":{"observed_at":"2026-08-07T12:58:04.791744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:11.018428Z","title":"Safetensors,","venue":null,"work_id":"1b7fd1a4-9aad-4354-9011-26140382af5c","year":2024},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:04.876060Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:1b3240b12315bf10151c116c64e06bec382d08303318530403b587d4d3f819c1","observation_id":"89ee66e9-bbba-4b12-ab18-81eab9f57679","resolution":{"observed_at":"2026-08-07T12:58:11.115727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:10.819379Z","title":"Models – Hugging Face,","venue":null,"work_id":"a44a7044-2d26-4681-9125-7e0b64815b39","year":2025},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:04.943400Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:daa690389bbb6e0e3e9b2884bba9041d92d69f47d8ef5305955116d701fdd37f","observation_id":"bc3dc6c4-e620-4184-8408-f68174e86e7b","resolution":{"observed_at":"2026-08-07T12:58:10.934865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:10.603583Z","title":"pickle — Python object Serialization,","venue":null,"work_id":"e2cc6277-2fc2-4894-81f8-8031dff02752","year":null},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:05.012673Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:17c2bd71f594fd6641058f02ffc51f9720fe6f64118d48361cc8cee59d1d3693","observation_id":"8718fe95-bf6e-4e3d-8bfd-c7ac573d3059","resolution":{"observed_at":"2026-08-07T12:58:10.697345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:10.217384Z","title":"Pytorch,","venue":null,"work_id":"2ff4dbf0-040b-4cfb-bfc5-717f1a7c9c2b","year":2024},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:05.160118Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:2ef8985443840c04471e78b8d4b679ea3f883052dd16ec101e9522e2bc3f89b2","observation_id":"a4160a11-7b76-4e06-ac30-f8ef8dab91ce","resolution":{"observed_at":"2026-08-07T12:58:10.287909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:10.363472Z","title":"Available: https://docs .python.org/3/library/pickle.html","venue":null,"work_id":"ecd2ef17-e684-425e-9a01-819b6604b23b","year":null},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:05.086172Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:56063b0bd7abbf4624af50ab1fb4b0ef36e54e29d49388fbf79f6e8e8d985cd8","observation_id":"d5df08d8-f0c5-4082-a97e-39e272121d0e","resolution":{"observed_at":"2026-08-07T12:58:10.472708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.07857","last_updated":"2021-04-16T02:22:12Z","snapshot_observed_at":"2026-07-06T11:00:07.753513Z","submitted_at":"2021-04-16T02:22:12Z","title":"ZeRO-Infinity: Breaking the GPU Memory Wall for Extreme Scale Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.07857","snapshot_observed_at":"2026-08-07T12:58:05.322950Z","title":"ZeRO- Infinity: Breaking the GPU Memory Wall for Extreme Scale Deep Learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:05.322950Z"},"links":{"cited_paper":"/paper/2104.07857","citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:4b56f6d05fb2bfb7cdc9f6dd9e478ca3409c9e712bacbe81b9b04d7aaa23adf6","observation_id":"eac066d1-55ad-4914-9134-18f059fbd4c8","resolution":{"observed_at":"2026-08-07T12:58:05.322950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:10.066791Z","title":"TensorFlow: A System for Large-Scale Machine Learning,","venue":null,"work_id":"6a43a9f5-f698-4341-b114-5fda732d9817","year":2016},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:05.256431Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:56004293419850cec6677ba98f3b0875b478b2077bb054150b537e1bd6287982","observation_id":"1c0e8d69-88b5-4a1d-9c5e-c55ee495787a","resolution":{"observed_at":"2026-08-07T12:58:10.162396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:09.881028Z","title":"ByteCheckpoint: A Unified Checkpointing System for Large Foundation Model Development,","venue":null,"work_id":"63e994f3-b1a7-4d6f-8f3e-8a57c033616f","year":null},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:05.583944Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:3e94184f9cbbc176134c9aadd5ceecd38c469073152943d3b8b53fd8a2543aef","observation_id":"f87c9321-eb6f-4360-a83c-21e94e87b89e","resolution":{"observed_at":"2026-08-07T12:58:09.974543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:05.415353Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:05.415353Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:307cb0bb5e1888c2b8877b219373b1d5e0efbcff3a37ffcf78fd8de75ead3dee","observation_id":"da9d9610-51ee-4e8f-8d8d-fd5c57aa3058","resolution":{"observed_at":"2026-08-07T12:58:05.415353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:09.472229Z","title":"NVIDIA Magnum IO GPUDirect Storage Design Guide,","venue":null,"work_id":"b6eb0fb1-aed3-4b72-9800-deec39b5ce09","year":null},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:05.795124Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:ff9e4eaf4dd9a4465d0e162e7bb1cce23c55e5f26b7dd9f5a8adc9bc0c3a3b35","observation_id":"f5fdf0db-d9a9-45f0-a3a6-9d4f12f43a1b","resolution":{"observed_at":"2026-08-07T12:58:09.563051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T12:58:05.994728Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:05.994728Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:b989171803e6fef1d6f70a636e0979b7817eb7f429f9f5c32753439682d3c4ab","observation_id":"ea280cc0-7b24-4930-8870-e6faefdd52ae","resolution":{"observed_at":"2026-08-07T12:58:05.994728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20143","last_updated":"2025-04-02T06:05:23Z","snapshot_observed_at":"2026-07-06T18:53:26.968088Z","submitted_at":"2024-07-29T16:18:20Z","title":"ByteCheckpoint: A Unified Checkpointing System for Large Foundation Model Development","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20143","snapshot_observed_at":"2026-08-07T12:58:05.667602Z","title":"Available: https://arxiv .org/abs/2407.20143","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:05.667602Z"},"links":{"cited_paper":"/paper/2407.20143","citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:7b137d47b2bf467327a48ec1073b9dcaf024dc5190c68cc5f8aad6e3b1af25b6","observation_id":"17d7f8ea-1c41-42aa-b6e3-5e2dfc00f514","resolution":{"observed_at":"2026-08-07T12:58:05.667602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:09.685827Z","title":"Welcome to DLPack’s documentation! — DLPack 0.6.0 documentation,","venue":null,"work_id":"8dd3ac18-a702-43d8-9ce0-baed880fb69b","year":2022},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:05.733164Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:4a5913abf80b231dbcea1f299e00e0c836592bf42445f656afcd000bed0579d3","observation_id":"bcd5b2ae-657d-4b94-bf1a-6bd50878fd60","resolution":{"observed_at":"2026-08-07T12:58:09.782963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:09.084962Z","title":"huggingface/text-generation-inference: Large Language Model Text Generation Inference,","venue":null,"work_id":"22054f7f-726d-47e6-ade6-0aac13562704","year":2024},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:06.274780Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:b47417b16800b849e77cb956695e78ec5a4ee7e693162ec2358fc35776d6c6fb","observation_id":"44d43244-a860-49cb-a83a-d032e69233e5","resolution":{"observed_at":"2026-08-07T12:58:09.177797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:08.887405Z","title":"vllm-project/vllm: A high-throughput and memory-efficient inference and serving engine for LLMs,","venue":null,"work_id":"47283607-b2d3-4e58-833f-8462b2e720ac","year":2024},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:06.378960Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:5ad511e96d1654656cd0d6bf691ad2797ffb3b9cd5c5cda9cbbb14f8ee441cf3","observation_id":"6356c0c6-767c-49d9-842a-31481fc4d10e","resolution":{"observed_at":"2026-08-07T12:58:08.966023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:06.449698Z","title":"SGLang: Efficient Execution of Structured Language Model Programs,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:06.449698Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:ab9926cadf00680f2378172640d38a2206fcf813e84102b075f86151cc3f29ce","observation_id":"1145e70a-359e-48e6-99fa-8aa855cee725","resolution":{"observed_at":"2026-08-07T12:58:06.449698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16867","last_updated":"2023-11-29T19:45:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-28T15:12:47Z","title":"The Falcon Series of Open Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16867","snapshot_observed_at":"2026-08-07T12:58:06.100629Z","title":"The Falcon Series of Open Language Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:06.100629Z"},"links":{"cited_paper":"/paper/2311.16867","citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:90316b39a5b9b1370a74a412fa81e007a2b7413a09cc8c8549b6f8d501584dde","observation_id":"11caba6e-a8c6-410f-a6e8-0f52e01635ec","resolution":{"observed_at":"2026-08-07T12:58:06.100629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05100","last_updated":"2023-06-27T09:57:58Z","snapshot_observed_at":"2026-08-04T18:56:03.233715Z","submitted_at":"2022-11-09T18:48:09Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05100","snapshot_observed_at":"2026-08-07T12:58:06.183400Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:06.183400Z"},"links":{"cited_paper":"/paper/2211.05100","citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:6e92665d35202131badb1de0b55c1bc79cf2b4c0d386aa8a74169328319d9e9c","observation_id":"911f8b35-c10d-40d5-bf03-ef139478ad66","resolution":{"observed_at":"2026-08-07T12:58:06.183400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:08.421283Z","title":"PEP 703 — Making the Global Interpreter Lock Optional in CPython,","venue":null,"work_id":"84810c3c-0817-40d0-9ad8-6701d79283c3","year":2023},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:06.692824Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:b627592b8e9e0c0441efc759d5a7ef98cd22091700486c8d083ab939d4acc80e","observation_id":"0471cae3-d345-484f-a461-0339ac493343","resolution":{"observed_at":"2026-08-07T12:58:08.485679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:08.229369Z","title":"SPIN: Seam- less Operating System Integration of Peer-to-Peer DMA Between SSDs and GPUs,","venue":null,"work_id":"e362b628-6dda-4971-91d3-3aa434f7712b","year":2017},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:06.791585Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:25b49a7a31d45a87645157fd93a687402d2a5bf03e7bcad79999aeb1ddd7e4f4","observation_id":"beddeef5-3e13-41b1-9354-49ff7190c4d2","resolution":{"observed_at":"2026-08-07T12:58:08.306983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:08.093231Z","title":"How beneficial is peer-to-peer DMA?","venue":null,"work_id":"816199c5-ab75-4923-a7d7-0cf425844597","year":2020},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:06.863437Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:a97a1200c3d18994b5174e8a01697f54e6503fcfd6088d42dc72bd0e871b8442","observation_id":"55590a15-344c-4e65-857b-a27540e8f8c1","resolution":{"observed_at":"2026-08-07T12:58:08.178224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-07T12:58:06.513769Z","title":"Available: https://arxiv .org/abs/2312.07104","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:06.513769Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:48a5333f26df6ca5f5f12b249137c8afdba1c247c7e996cf75a6d017947b534d","observation_id":"3ee878dd-2212-47c6-ba76-acdff335049c","resolution":{"observed_at":"2026-08-07T12:58:06.513769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:08.722043Z","title":"Rapid Data Pre- Processing with NVIDIA DALI,","venue":null,"work_id":"35b73cee-08fe-4107-b748-e9c6273ab331","year":2021},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:06.584427Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:e0f4f5851aaa72f56f71744f5bdc17229e763c682b08092c9af99e7b29cef2c0","observation_id":"bee2d220-7aeb-4748-819b-4dc82321b264","resolution":{"observed_at":"2026-08-07T12:58:08.800106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:08.567007Z","title":"Accelerate AI and ML workloads with OCI, NVIDIA Magnum IO GPUDirect Storage, and IBM Storage Scale,","venue":null,"work_id":"c25338e8-6eb5-4694-84f0-12ea324cec95","year":2023},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:06.654325Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:bf9be565350a0b3a8c79e2afb339d15cb5c87a3bd771e09264bd28fc2bc1ae0e","observation_id":"b828a218-c17b-406d-b38d-c4422a76126c","resolution":{"observed_at":"2026-08-07T12:58:08.649672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.05433","last_updated":"2022-09-29T20:47:07Z","snapshot_observed_at":"2026-07-06T13:51:20.183063Z","submitted_at":"2022-09-12T17:39:55Z","title":"FP8 Formats for Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.05433","snapshot_observed_at":"2026-08-07T12:58:07.253100Z","title":"FP8 Formats for Deep Learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:07.253100Z"},"links":{"cited_paper":"/paper/2209.05433","citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:42b1c8a8a1f5b480bd6424b6a76bf1145371ae9681b2b7b104b8e2c1477bfd9b","observation_id":"84dd1e58-3951-47ed-a478-0fe6cd855632","resolution":{"observed_at":"2026-08-07T12:58:07.253100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14592","last_updated":"2024-03-31T23:05:53Z","snapshot_observed_at":"2026-07-06T16:23:38.359686Z","submitted_at":"2023-09-26T00:58:36Z","title":"Efficient Post-training Quantization with FP8 Formats","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14592","snapshot_observed_at":"2026-08-07T12:58:07.344437Z","title":"Efficient post-training quantization with fp8 formats,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:07.344437Z"},"links":{"cited_paper":"/paper/2309.14592","citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:c78f275cc2e7305bd8813596db8f9d5645c36b195b43620459312812e6a4c490","observation_id":"151eca64-8839-4a13-bc73-a709b13deba7","resolution":{"observed_at":"2026-08-07T12:58:07.344437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.09225","last_updated":"2024-02-23T13:49:45Z","snapshot_observed_at":"2026-08-01T08:03:58.744148Z","submitted_at":"2022-08-19T09:03:00Z","title":"FP8 Quantization: The Power of the Exponent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.09225","snapshot_observed_at":"2026-08-07T12:58:07.427165Z","title":"FP8 Quantization: The Power of the Exponent,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:07.427165Z"},"links":{"cited_paper":"/paper/2208.09225","citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:7d513af2f488358c33661ae164d9e068fee9afbe951363b85c16ea9dffe450a7","observation_id":"8514445a-46b1-414c-9313-606aeec79f5a","resolution":{"observed_at":"2026-08-07T12:58:07.427165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:07.936284Z","title":"Column Cache: Buffer Cache for Columnar Storage on HDFS,","venue":null,"work_id":"6a530c28-373f-46c5-86c0-9c0ad5f81c06","year":2018},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:06.941011Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:31ed1c19470ebe6ec6b5b039cd3f98def854a7bdfeffc8ff96d67372219e7ae9","observation_id":"0ce17f57-773f-4db8-a49a-e450f646dbc0","resolution":{"observed_at":"2026-08-07T12:58:08.008794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:07.813617Z","title":"Teraheap: Reducing memory pressure in managed big data frameworks,","venue":null,"work_id":"9998bfa2-b248-4b12-b570-0439b4a17dbe","year":2023},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:07.049645Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:b77d47dbd1842f35123023b8ee6970fb9cdabc5ad91b86940e98a1cbbc1ae10e","observation_id":"4525d906-06ac-473e-a464-382a9ac9027a","resolution":{"observed_at":"2026-08-07T12:58:07.862265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:07.662253Z","title":"Accelerating multilingual applications with in-memory array sharing,","venue":null,"work_id":"9426f990-405d-45ac-a2b1-3d0eaefad074","year":2023},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:07.153431Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:e720a31392ae623fe808be59763b1626cbacfb8fc8718db6664ebc3a66a90530","observation_id":"fc358a47-a979-4eb3-9fd4-c52b5fc52e0b","resolution":{"observed_at":"2026-08-07T12:58:07.752961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-07T12:58:05.511142Z","title":"Available: https://arxiv .org/abs/2304.11277","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:05.511142Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:d974906431420f39b9920868dab110b0a8fdb7781804f8ca3ea8b41d6e1d9581","observation_id":"5d4bbd67-4c41-4ccf-be99-f739761dd62b","resolution":{"observed_at":"2026-08-07T12:58:05.511142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04324","last_updated":"2024-05-07T13:50:40Z","snapshot_observed_at":"2026-07-06T18:11:01.734775Z","submitted_at":"2024-05-07T13:50:40Z","title":"Granite Code Models: A Family of Open Foundation Models for Code Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04324","snapshot_observed_at":"2026-08-07T12:58:04.032742Z","title":"Available: https://arxiv .org/abs/2405.04324","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:04.032742Z"},"links":{"cited_paper":"/paper/2405.04324","citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:f9d868589a08bd3b28b20858f19ad2b7783ffee46311dcaffcf584b2db0bcefb","observation_id":"465ebe04-efce-4d36-a082-c9493210a02f","resolution":{"observed_at":"2026-08-07T12:58:04.032742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:09.273649Z","title":"Available: https://docs .nvidia.com/gpudirect-storage/ design-guide/index.html","venue":null,"work_id":"ad9ae3cc-a895-4e70-9445-c86486e2f778","year":null},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:05.911032Z"},"links":{"citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:b30dc6d443f7a68dcb7110f14f76c7c1336c9b857db9b6af309fb5359401383f","observation_id":"842d19cb-7c3f-4cbd-a9ff-095b167ac77c","resolution":{"observed_at":"2026-08-07T12:58:09.368234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-07T12:51:48.896109Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":30},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 4 inbound Pith citation observations for arXiv:2505.23072."}