{"as_of":"2026-08-08T08:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4d5490194933b370b59d4f79e2a6b6edc197f9555092ea5a37f3eaf314841f05","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T11:38:43.594150Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.02480/citation-record","integrity":"/paper/2509.02480/integrity","json":"/paper/2509.02480/citation-record.json","paper":"/paper/2509.02480"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:53.011812Z","title":null,"venue":null,"work_id":"b2bc981d-c6cb-4586-80b3-8f5ad49c7243","year":2025},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:36.786441Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:4997e705ec41c323930856a62dc2af2676cf501c15e89401671299ee7223cb13","observation_id":"8f7cb4e3-557e-49d1-9dc8-6b681dc73b8b","resolution":{"observed_at":"2026-08-05T11:38:53.151038Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:52.776043Z","title":null,"venue":null,"work_id":"24f2b69c-3e73-4e9d-8ed9-1cc53d1adbab","year":2023},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:36.840712Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:fa8246ed41354e5b769687f5020132b72e6e6e593cdf2713d849173cb52d6bcc","observation_id":"bd90373c-d969-4ace-a5bb-a699014f602d","resolution":{"observed_at":"2026-08-05T11:38:52.906869Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:52.436826Z","title":null,"venue":null,"work_id":"1552d9fa-e260-495c-ab0c-7074b9dadb19","year":2025},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:36.979528Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:7b3b32990266c1099c4d9c3914a91184539574bfdae08066aed8af1c2b456f39","observation_id":"bb630c1a-8681-4477-ab9a-b8368e2bfe26","resolution":{"observed_at":"2026-08-05T11:38:52.615465Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:52.211955Z","title":"Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared Kaplan, et al","venue":null,"work_id":"c63f63a9-ea49-47f3-ac33-8a8a6462f3c9","year":null},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:37.102458Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:3aca119df528dbafbc7a5c6d91df551b5f2ca0e21261e973e5b4962f56756f84","observation_id":"5dfed2d4-5152-43bb-acd5-0cc443368d6d","resolution":{"observed_at":"2026-08-05T11:38:52.308637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:37.406171Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:37.406171Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:3e6a89b17e2c5fee8ce2b5ac050cd390b9fa3d1e250f58900a02417713c4996e","observation_id":"10c4f528-9f8a-4b31-9126-6eb15f8071d1","resolution":{"observed_at":"2026-08-05T11:38:37.406171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:51.661571Z","title":null,"venue":null,"work_id":"526de315-04dc-49b6-9377-32e3293a53fd","year":2024},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:37.574924Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:ca1ef178dff0a7bfa3cd2e8a6c49e20b5ea0564e24cb9ebc33e5ba88e17a8d37","observation_id":"bbec794c-e7fd-40e2-8aa0-6c4fb0058b67","resolution":{"observed_at":"2026-08-05T11:38:51.764829Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:51.423690Z","title":null,"venue":null,"work_id":"dfb42a74-4892-453a-942f-ec580db36563","year":2025},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:37.694428Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:4b49842ffed7f09600078e047f0995512e930468b65a776c46f0a6e1b1eea8ec","observation_id":"51bcb0df-9538-4119-9617-c8a6ff037229","resolution":{"observed_at":"2026-08-05T11:38:51.491030Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:51.187126Z","title":null,"venue":null,"work_id":"6bdb209a-0a8a-4b38-b7a2-b42f7fe6c0fd","year":2022},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:37.807438Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:f7f87f59872f8881a04d03643c6e6241d66b6c3830158fe71cf376eb3d831101","observation_id":"6b5c2501-94c5-45ed-a357-a3b6f4069406","resolution":{"observed_at":"2026-08-05T11:38:51.285106Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20018","last_updated":"2024-07-29T13:53:27Z","snapshot_observed_at":"2026-07-06T18:53:22.585501Z","submitted_at":"2024-07-29T13:53:27Z","title":"Efficient Training of Large Language Models on Distributed Infrastructures: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20018","snapshot_observed_at":"2026-08-05T11:38:37.916772Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:37.916772Z"},"links":{"cited_paper":"/paper/2407.20018","citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:943308504be984cc6246b1e76d1db469120d6701ff53aa33a3d89057f52d483a","observation_id":"b2f3e50e-429e-49c5-a34f-2335320523e8","resolution":{"observed_at":"2026-08-05T11:38:37.916772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:50.919932Z","title":null,"venue":null,"work_id":"1fd420b0-fda4-4951-b11a-9f6f2c6c489e","year":2024},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:38.066086Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:815c1f7021fc9e37891268f60b483b9db5ed2c80119c6ec67b38537840411b09","observation_id":"bda7e1bd-d2c4-49b4-9ec8-fea45773290f","resolution":{"observed_at":"2026-08-05T11:38:51.059048Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:50.670066Z","title":"Gossman, Bogdan Nicolae, and Jon C","venue":null,"work_id":"73d00781-97fe-4f09-823d-cfaed9bdf9f9","year":2024},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:38.190543Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:3d733d9c7aa02b2d921add58c74841fda9984d3d0216140ddf131a8e555bc0fd","observation_id":"06ec4aa8-ca81-488c-a918-abe030ec33fe","resolution":{"observed_at":"2026-08-05T11:38:50.770531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:50.494382Z","title":null,"venue":null,"work_id":"a9fb096d-1dc1-4f59-aa5d-40cc1316a83f","year":2023},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:38.300156Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:a6a2d0f4d577bd080d8d020ef06f8ccbb2f010ab2cdf8554c5d6679d5974fcba","observation_id":"ff3dd74b-d2da-4c45-bfb8-ad670f02b517","resolution":{"observed_at":"2026-08-05T11:38:50.566283Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:50.227753Z","title":"Le, Yonghui Wu, and Zhifeng Chen","venue":null,"work_id":"319a91c8-0e5b-41cc-b65e-197b7d200b7c","year":2019},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:38.445568Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:6e3b9e9afe2cce8e8415eafd04a0e1113d93dbc47dc252b3723af29a73dc815d","observation_id":"c1a3fa04-5937-4b19-a0e8-15522e712da2","resolution":{"observed_at":"2026-08-05T11:38:50.345683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:49.879588Z","title":null,"venue":null,"work_id":"206b50e2-b3ff-4364-ba3e-54b824aa7c49","year":2024},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:38.533550Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:440810bb6c576adbc767e10e42ec4913a0acce20c66344a3dbc5191f64f81df7","observation_id":"d4de6591-38d4-4d5b-9fcd-ca2a9dd34fa3","resolution":{"observed_at":"2026-08-05T11:38:50.053594Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01142","last_updated":"2024-11-02T05:15:44Z","snapshot_observed_at":"2026-07-06T19:43:59.326124Z","submitted_at":"2024-11-02T05:15:44Z","title":"NEO: Saving GPU Memory Crisis with CPU Offloading for Online LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01142","snapshot_observed_at":"2026-08-05T11:38:38.649427Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:38.649427Z"},"links":{"cited_paper":"/paper/2411.01142","citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:5b06766b6423ceb484380eee55a63e9811106468c073905c67cb56b4e67157ff","observation_id":"4996d107-590b-4deb-a312-6b60d50f8a4f","resolution":{"observed_at":"2026-08-05T11:38:38.649427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:49.594384Z","title":null,"venue":null,"work_id":"0e9c0fae-80e7-43d4-b024-395603f598f7","year":2024},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:38.746060Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:1da9872c300df970fe6d04f3694134be1dca9164975f9c47f4542eb32ac68aad","observation_id":"cb386f23-f7fc-41fa-9b95-5aa4e635fa3d","resolution":{"observed_at":"2026-08-05T11:38:49.767252Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T11:38:38.892288Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:38.892288Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:d091b71932cbba4c1d5fb24824852fe7b4be390dda589164d3930ca0520c9172","observation_id":"bab7dfef-43c4-43e1-8f87-4d873d15e4ea","resolution":{"observed_at":"2026-08-05T11:38:38.892288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:49.349946Z","title":null,"venue":null,"work_id":"3fb26648-2eba-483c-b2bf-03521791c110","year":null},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:38.978404Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:82b63794604f2650cc8a0454e8e85484a9cb8b840d9c7d63719d5d0879073c95","observation_id":"4749c705-8a92-4bce-89c8-7d3f2bb92feb","resolution":{"observed_at":"2026-08-05T11:38:49.449831Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:49.056626Z","title":null,"venue":null,"work_id":"b17b6d2d-adaa-426c-8d3b-97b5031d9c15","year":2023},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:39.206159Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:a873f09e37c2b5462877f0e5018e7c40b3f6a40612459f89b4274ac02ce22adb","observation_id":"521c9046-19c5-44b0-b8fa-1224f262fa78","resolution":{"observed_at":"2026-08-05T11:38:49.163997Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16645","last_updated":"2024-04-25T14:34:47Z","snapshot_observed_at":"2026-07-06T18:05:34.109470Z","submitted_at":"2024-04-25T14:34:47Z","title":"Tele-FLM Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16645","snapshot_observed_at":"2026-08-05T11:38:39.264344Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:39.264344Z"},"links":{"cited_paper":"/paper/2404.16645","citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:d97ad3147eca9cad786d9c5af69e863a72b830a78c73418394d69b62a99b399c","observation_id":"8194b000-6d27-4095-bbed-749069c775af","resolution":{"observed_at":"2026-08-05T11:38:39.264344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06504","last_updated":"2024-12-24T13:41:08Z","snapshot_observed_at":"2026-07-06T17:42:29.208344Z","submitted_at":"2024-03-11T08:25:53Z","title":"LoHan: Low-Cost High-Performance Framework to Fine-Tune 100B Model on a Consumer GPU","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06504","snapshot_observed_at":"2026-08-05T11:38:39.507558Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:39.507558Z"},"links":{"cited_paper":"/paper/2403.06504","citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:bae0c4def6f0549779816f3e86d4196ae49c36d89e46c5d328a6b38b77f2e570","observation_id":"ae8bfc6c-65c6-4abc-a016-282111a76e94","resolution":{"observed_at":"2026-08-05T11:38:39.507558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-05T11:38:39.594023Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:39.594023Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:f281126701c905c8691468802a43281e72304cc7e6f1f67780b74e79bb1790fb","observation_id":"79c8079e-9c95-4508-aabf-4b41d7405f9f","resolution":{"observed_at":"2026-08-05T11:38:39.594023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:48.757620Z","title":"Mustafa Rafique, Franck Cappello, and Bogdan Nicolae","venue":null,"work_id":"d78b1803-6218-4f0c-84e3-4b4000035b27","year":2024},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:39.702793Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:4d2466c4805de3649f1c675044d8f0292b4e53b67bfb0dd8f82da59d633cc621","observation_id":"1e6f0ff3-1894-4012-83c0-afa5165ef652","resolution":{"observed_at":"2026-08-05T11:38:48.903652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:48.494855Z","title":"Mustafa Rafique, Franck Cappello, and Bogdan Nico- lae","venue":null,"work_id":"14829a4e-fd5e-47d7-aad0-2dc7f4cf9d33","year":2024},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:39.833340Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:7071bafd989f0e45c77f9fe92cbf8a1589f4e4b7ad768777bb8802980f33af2b","observation_id":"a18a11cf-b423-474e-9e46-e58fefb82f53","resolution":{"observed_at":"2026-08-05T11:38:48.625303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:48.246657Z","title":null,"venue":null,"work_id":"b2703d78-5930-4d5d-ab76-5daba3615483","year":null},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:39.972863Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:663af5f8d83733229d0f2876affddd9a87c427a7bf77339c4df671825cd52bc1","observation_id":"87b494d6-4f45-4be2-9adf-bb8fa66fb075","resolution":{"observed_at":"2026-08-05T11:38:48.386105Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T11:38:40.255601Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:40.255601Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:eae00eb3ea0f2ebaac7fdcb8db5fabe76b05c2aced38ac0815875f059f7449e2","observation_id":"ddd2ba66-2cfd-46d5-92d6-2e00f250bd34","resolution":{"observed_at":"2026-08-05T11:38:40.255601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-05T11:38:40.362174Z","title":"Rae, Sebastian Borgeaud, Trevor Cai, Katie Millican, et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:40.362174Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:70c169b01780d5c15896d28d7a56fc60dc817b644638811cf35350b08a55d67a","observation_id":"291e8bae-d605-4883-ab29-b69977bf2796","resolution":{"observed_at":"2026-08-05T11:38:40.362174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:47.991188Z","title":"In Proceedings of the 25th International Middleware Conference","venue":null,"work_id":"4b47c809-d5ad-49d9-90c6-93644fabc6d4","year":null},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:40.068586Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:1393efff0173ad95fa0b50dcfa56f28f3b354e5081eeb73481d0dcb412b99559","observation_id":"366f06c4-e882-4c65-99ab-9429e65ab362","resolution":{"observed_at":"2026-08-05T11:38:48.114433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:47.473659Z","title":null,"venue":null,"work_id":"f6154657-c583-4492-9f70-ee8e80933ef1","year":2021},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:40.611835Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:5d3a25cd5687d728dff5de1b60a5d42a49af109bed9cc901fbec0d538fd2849f","observation_id":"981d10a7-ab29-4af7-a7e6-1adf9b55ac21","resolution":{"observed_at":"2026-08-05T11:38:47.573627Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:47.225592Z","title":null,"venue":null,"work_id":"d38a8089-e5d6-4546-b57c-d0a9da597ed5","year":2020},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:40.692421Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:af0e30165ba04baef87c62ec5434efa657310190e85034e4f816c5563426c555","observation_id":"7456d313-3b08-4bb5-b263-32b3f869f151","resolution":{"observed_at":"2026-08-05T11:38:47.301521Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:47.749979Z","title":null,"venue":null,"work_id":"cfe7fca7-9178-426d-8cbb-fc6460f3c184","year":2020},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:40.501382Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:ad377234a16bdd325d29f78be532163d4574df0d37790458db460850b5ae3963","observation_id":"15a15961-5794-4964-a3d5-376cf96a2dad","resolution":{"observed_at":"2026-08-05T11:38:47.857524Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T11:38:40.899514Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:40.899514Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:c2918797a20efc7b2cb00706db591ac4152bd4d503377045b73cac5cdb892d1c","observation_id":"705d33f3-c8df-4c0f-81e4-0d44d97bb250","resolution":{"observed_at":"2026-08-05T11:38:40.899514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04610","last_updated":"2023-10-11T23:15:43Z","snapshot_observed_at":"2026-08-02T07:19:18.974804Z","submitted_at":"2023-10-06T22:05:15Z","title":"DeepSpeed4Science Initiative: Enabling Large-Scale Scientific Discovery through Sophisticated AI System Technologies","version":2},"cited_work":{"arxiv_id":"2310.04610","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.04610","snapshot_observed_at":"2026-08-05T11:38:43.814682Z","title":"DeepSpeed4Science Initiative: Enabling Large-Scale Scientific Discovery through Sophisticated AI System Technologies","venue":"cs.AI","work_id":"42ed2db3-bd24-44d5-b099-4e813676067d","year":2023},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:41.012743Z"},"links":{"cited_paper":"/paper/2310.04610","citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:92bb17a3524e6e67649508f62f510da5b3f85757fd22661b962db6a90e95bb97","observation_id":"ce9ea7f7-381d-48ca-ab94-cb46c01aba5f","resolution":{"observed_at":"2026-08-05T11:38:43.894727Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:46.989349Z","title":"2021.{Zero-offload}: Democratizing{billion-scale} model training","venue":null,"work_id":"13b23917-2a2a-46fa-aeeb-0bb21293861b","year":2021},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:40.798315Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:2970b9a299c47ff830960a8f1416e53f72efb4b45efc9d468a2a964462e8aade","observation_id":"81251ae9-c603-4eb5-b2f3-e81f448bd879","resolution":{"observed_at":"2026-08-05T11:38:47.091092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:46.749609Z","title":null,"venue":null,"work_id":"ceccc6f6-96c3-4fad-af9a-5cf689328212","year":2022},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:41.407731Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:44f3955211e0b1a4becaab0e92d04c612bea2e723a2f899448b76ab3b7498a93","observation_id":"703d53da-8423-4640-acbe-eb40a4590fcf","resolution":{"observed_at":"2026-08-05T11:38:46.879107Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:46.567402Z","title":null,"venue":null,"work_id":"3a229b57-287d-41e4-83dc-5b5af9dd57ad","year":2025},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:41.548733Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:7fd09b1bbfd359591e233c1c7db043d7976eea347ee6bee2c158fa1cda020c93","observation_id":"a177600e-eec7-42c9-81b4-d22ecc57fc3c","resolution":{"observed_at":"2026-08-05T11:38:46.629980Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:41.124129Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:41.124129Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:3904215d3d2531e46accffaa5b0e6c3e6331cc4bb6bd7ba3b06e6f3264d8b965","observation_id":"71ea7f72-3fb2-41e0-b9d2-1ee57be956c8","resolution":{"observed_at":"2026-08-05T11:38:41.124129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:41.894876Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:41.894876Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:00ae041b6f6b7af0359f1f14696ec6101de728e6ce6504d58de0e04b979e2a3d","observation_id":"d6623328-7103-42bf-9d85-dc2e53ff5383","resolution":{"observed_at":"2026-08-05T11:38:41.894876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:46.051665Z","title":null,"venue":null,"work_id":"f1346349-7478-4405-9735-68b8ec0fc2eb","year":2023},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:42.129588Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:74a697e0936fac24470886311daf2be9fa077173a79ebefffec60e8305ce2e56","observation_id":"28d8239e-dd88-4620-97a7-c6618ccee150","resolution":{"observed_at":"2026-08-05T11:38:46.183026Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:46.278296Z","title":null,"venue":null,"work_id":"4400b6e0-29bd-4269-9692-4c474a59ca3a","year":2025},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:41.645601Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:ce1c6de4432cdef894f57e1c694b60ba24a47044fd9854e1583bf4a3aa7c4272","observation_id":"37e2053b-1e02-4640-9faa-bd3f131f40ed","resolution":{"observed_at":"2026-08-05T11:38:46.400129Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:45.599868Z","title":null,"venue":null,"work_id":"f2f95d44-a707-47c6-b48e-0582b1b0db23","year":2023},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:42.325984Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:897883b68f3fd2ae71cae5d36cd88055ad4c078bba064167fd71208f313afcde","observation_id":"857c990d-289d-4092-94fb-f766fc2dd004","resolution":{"observed_at":"2026-08-05T11:38:45.710254Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:45.286057Z","title":null,"venue":null,"work_id":"82f55620-30cd-479c-bd28-aaf4d2f01208","year":2023},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:42.473936Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:8c03cbf34e5cdeeafe3abc7aa758b9154432001450a1355183a2aed5353e9d4a","observation_id":"78000de3-c2c5-421f-b5f5-a712c97ec546","resolution":{"observed_at":"2026-08-05T11:38:45.441445Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05100","last_updated":"2023-06-27T09:57:58Z","snapshot_observed_at":"2026-08-04T18:56:03.233715Z","submitted_at":"2022-11-09T18:48:09Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05100","snapshot_observed_at":"2026-08-05T11:38:42.606347Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:42.606347Z"},"links":{"cited_paper":"/paper/2211.05100","citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:d204e30eeb17a0ff6ad9dd526c7fe779f9cbfd3bef79b4f70f9abdcb91284f1b","observation_id":"d545158b-5cef-465b-b11d-cf9e99b0da4e","resolution":{"observed_at":"2026-08-05T11:38:42.606347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:45.058059Z","title":null,"venue":null,"work_id":"9389b107-09b9-4596-8ded-de73b8f214d9","year":2024},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:42.729792Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:b03ad69e164d6693bfb81419da2bc05cc600269fb1e3a670af665bb1cd43e037","observation_id":"57e88d3d-73e9-4e5b-9031-aa5466853548","resolution":{"observed_at":"2026-08-05T11:38:45.186354Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:45.831775Z","title":null,"venue":null,"work_id":"c75e44fa-29c7-490b-a1aa-29028e73947a","year":2023},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:42.200250Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:77400a55dc756ab9666e07c269a2d4e8b7d3f76246332131b7b04e10a78e664e","observation_id":"d4f6e8fd-5e8c-4ec0-9dcd-ee46416fd630","resolution":{"observed_at":"2026-08-05T11:38:45.934373Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:44.789324Z","title":null,"venue":null,"work_id":"74bffcdd-e49e-451a-9655-ff5e19dff323","year":null},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:42.999981Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:49ac0882dd6e6b3bca1b6e8e3b8d7fc060fd8d386f319446ba5768dbde4c6bd9","observation_id":"530e82e5-791d-41de-a43f-e45747fe414c","resolution":{"observed_at":"2026-08-05T11:38:44.952742Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-05T11:38:43.165034Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:43.165034Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:a332c817bb6c5dfc3148801bd76180ea5c276cd8fc231337658cc2ab64e13f71","observation_id":"a3bd426f-a9fd-45ae-8da0-567a96ecde36","resolution":{"observed_at":"2026-08-05T11:38:43.165034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:44.573456Z","title":null,"venue":null,"work_id":"9363351e-841e-4dac-b84b-b98e80bcb5e6","year":2019},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:43.272998Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:ff65eaadedeacd2fe7bb1ad2238cc4505d4b786f608b417a8cbcb6e01dead91f","observation_id":"eeefe1cc-7ae4-4531-826d-d2b1b77f259c","resolution":{"observed_at":"2026-08-05T11:38:44.676791Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-05T11:38:43.383226Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:43.383226Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:7bb3eadf0d3324860349f19ebbe43eeb9585476aa5ccf01935a146acf6dc9a72","observation_id":"9b723a75-e2ce-43c5-b54d-d01fa601bd72","resolution":{"observed_at":"2026-08-05T11:38:43.383226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:44.100418Z","title":null,"venue":null,"work_id":"6102b693-dd96-4020-ba64-b66c443c7bd4","year":2023},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:43.594150Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:a5c0d8e7ebbc94420ae4f823b17bfb70b1ef31fe16b8e22ad91a721b43849ea9","observation_id":"e2979822-0f40-4178-ae0f-33d9a30eed79","resolution":{"observed_at":"2026-08-05T11:38:44.169747Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02414","last_updated":"2023-10-25T05:22:43Z","snapshot_observed_at":"2026-08-02T04:26:53.194797Z","submitted_at":"2022-10-05T17:34:44Z","title":"GLM-130B: An Open Bilingual Pre-trained Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02414","snapshot_observed_at":"2026-08-05T11:38:43.049078Z","title":"arXiv:2210.02414 [cs.CL] https://arxiv.org/abs/2210.02414","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:43.049078Z"},"links":{"cited_paper":"/paper/2210.02414","citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:99059cf78c3cea8b9aafb8ff61ba34d591ebc24c1e5f0008ea60eda0380cfbc2","observation_id":"5a1abba7-a43e-4d6a-9a3b-8a9cd4550d75","resolution":{"observed_at":"2026-08-05T11:38:43.049078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:44.291707Z","title":null,"venue":null,"work_id":"79648ddb-3979-4d8f-ab3e-7786a00e3458","year":2024},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:43.504626Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:9475d66ba93d87db2474e3de6bb9287a862b309ed8766caaac29f5a36d04a3de","observation_id":"49e71643-2851-48d7-b1b2-c6d72c3bd701","resolution":{"observed_at":"2026-08-05T11:38:44.413720Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:38:51.892513Z","title":"Advances in neural information processing systems 33 (2020), 1877–1901","venue":null,"work_id":"e6706319-854f-4684-abd9-199c16dbc092","year":2020},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:37.261416Z"},"links":{"citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:2df752196738da161ead84cc66939b8fe43686105f50ae5c3529fa9eb8c56824","observation_id":"e0312f58-ca1d-4317-bda8-480dfc0897a9","resolution":{"observed_at":"2026-08-05T11:38:52.024937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09085","last_updated":"2022-11-16T18:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-16T18:06:33Z","title":"Galactica: A Large Language Model for Science","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09085","snapshot_observed_at":"2026-08-05T11:38:41.269797Z","title":"arXiv:2211.09085 [cs.CL] https://arxiv.org/abs/2211.09085","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:41.269797Z"},"links":{"cited_paper":"/paper/2211.09085","citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:3768001d50ddfafa1042fba093e30f6450d30e7f7a5b449fc680dba5941b913c","observation_id":"5c827464-44cd-427e-bc54-24799bb78c4d","resolution":{"observed_at":"2026-08-05T11:38:41.269797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T11:38:42.022158Z","title":"arXiv:2307.09288","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:42.022158Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:e2f7787980b133fb6b40f7f0e45695120e8c32a9bf4e884fc53b88b0efa66ad0","observation_id":"6dbadd35-626c-4352-a54d-d348a445c02a","resolution":{"observed_at":"2026-08-05T11:38:42.022158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18710","last_updated":"2025-03-25T11:11:03Z","snapshot_observed_at":"2026-07-06T18:21:44.232687Z","submitted_at":"2024-05-29T02:42:23Z","title":"To FP8 and Back Again: Quantifying Reduced Precision Effects on LLM Training Stability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18710","snapshot_observed_at":"2026-08-05T11:38:39.070207Z","title":"arXiv:2405.18710 [cs.LG] https://arxiv.org/abs/2405.18710","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:39.070207Z"},"links":{"cited_paper":"/paper/2405.18710","citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:0c8f760fb0f2af14ca692c71ec0e44b97cb6e80f6db3162d45e10c429debb0bf","observation_id":"f8dd3b74-e584-437d-81a2-bc188c0d66ad","resolution":{"observed_at":"2026-08-05T11:38:39.070207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-07T16:39:03.985890Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":1,"verified_fuzzy":8},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2509.02480."}