{"as_of":"2026-08-08T11:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4c0d7c217dd8947e9efa1aad47e455ececd6a13be943b3ab5f9586ea20c9eaa4","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T17:12:42.195329Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.11076/citation-record","integrity":"/paper/2509.11076/integrity","json":"/paper/2509.11076/citation-record.json","paper":"/paper/2509.11076"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:41.104152Z","title":"Murray, Benoit Steiner, Paul Tucker, Vijay Va- sudevan, Pete Warden, Martin Wicke, Yuan Yu, and Xiaoqiang Zheng","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:41.104152Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:25f52e10c2688a42d0401b2bd9822c5cccf1b4718f6d69830fbddb6ff85724bc","observation_id":"797489cb-11f9-413d-98b5-cfc49ddc171f","resolution":{"observed_at":"2026-08-04T17:12:41.104152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:41.150813Z","title":"Tensorflow eager: A multi-stage, python-embedded dsl for machine learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:41.150813Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:638d78e484b007a989818ca3e7c5cc6bcae857b49841e145c270adc83e7aaba8","observation_id":"9f6eb688-5040-446e-94c0-2d7e4ac829ce","resolution":{"observed_at":"2026-08-04T17:12:41.150813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:41.195175Z","title":"Accessed: 2024-12","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:41.195175Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:1597223060d59df3ded4e894eabc936e45ec29d888d188df7b94e6da35734ef3","observation_id":"7a26902c-15f2-4f2b-9a93-0107a2327dde","resolution":{"observed_at":"2026-08-04T17:12:41.195175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:41.246379Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:41.246379Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:862cce8d0c63e5cc127d6f01becf95e9e68aa9c999f9dd544121faef007c8d19","observation_id":"bc988602-2645-4db1-9e0f-18c3d9c30f3e","resolution":{"observed_at":"2026-08-04T17:12:41.246379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:41.297781Z","title":"Accessed: 2025-06","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:41.297781Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:27a82e6bf5a6bcf30d23daaa6977ecced42f8d5d2f0229ddf6e844477969000b","observation_id":"00ec6fc1-a5c3-4e06-ab35-60000b2a2eae","resolution":{"observed_at":"2026-08-04T17:12:41.297781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:41.321654Z","title":"Accessed: 2025-06","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:41.321654Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:48501d165ce4cb703d88317b279dc5a2d94da03fdb4645a8260d1a7615db3c25","observation_id":"36fd0431-fc20-45f3-8832-33b7e06c7949","resolution":{"observed_at":"2026-08-04T17:12:41.321654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:41.433480Z","title":"Accessed: 2025-08","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:41.433480Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:f03e1b38d66b945ec21105c34a317a516ccd94b380bb4589fc70ba693ff1fef5","observation_id":"dc0438bf-8698-4d22-8476-b9707d6b137d","resolution":{"observed_at":"2026-08-04T17:12:41.433480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:41.541213Z","title":"B, Anshuj Garg, and Purushottam Kulkarni","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:41.541213Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:be7f1ce67edc1fc5b786dfbe00c1114b67cc791640e798c0bfd9682f38920389","observation_id":"92711af2-aa84-4f57-9e5b-f9c68b8f4ffc","resolution":{"observed_at":"2026-08-04T17:12:41.541213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:41.614201Z","title":"Qwen2.5-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:41.614201Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:50baaf42d36938780e484293a4542aed009ca341508c96f4adda24d11662b30c","observation_id":"ac6b6635-7635-43d9-a051-917d6e76d559","resolution":{"observed_at":"2026-08-04T17:12:41.614201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:41.686642Z","title":"CSWAP: A self-tuning compression framework for accelerating tensor swapping in gpus","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:41.686642Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:a66267e9369440550c78f43105ae34b199bdbb8da2dd0681ffe252e65b5b99f0","observation_id":"31ce71fd-f98c-4098-b640-211ffe57b7e9","resolution":{"observed_at":"2026-08-04T17:12:41.686642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1512.01274","last_updated":"2015-12-03T22:49:21Z","snapshot_observed_at":"2026-08-08T00:52:59.189688Z","submitted_at":"2015-12-03T22:49:21Z","title":"MXNet: A Flexible and Efficient Machine Learning Library for Heterogeneous Distributed Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.01274","snapshot_observed_at":"2026-08-04T17:12:41.749621Z","title":"Mxnet: A flexible and efficient machine learning library for heterogeneous distributed systems.arXiv:1512.01274, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:41.749621Z"},"links":{"cited_paper":"/paper/1512.01274","citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:cac6ee22e54502d64bd4e08783ccf50d94423519a3a76b205ac9cd3f989cad8d","observation_id":"b97bfda7-41b9-4de2-aa49-ad4d51ebbf61","resolution":{"observed_at":"2026-08-04T17:12:41.749621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.06174","last_updated":"2016-04-22T19:21:36Z","snapshot_observed_at":"2026-08-08T09:03:25.135475Z","submitted_at":"2016-04-21T04:15:27Z","title":"Training Deep Nets with Sublinear Memory Cost","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.06174","snapshot_observed_at":"2026-08-04T17:12:41.807926Z","title":"Training deep nets with sublinear memory cost.arXiv:1604.06174, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:41.807926Z"},"links":{"cited_paper":"/paper/1604.06174","citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:ac6ee5ed70048585a55a711c71f4fdf8eb7e93c5eba24b87ea4af6b5f1663d3f","observation_id":"ccc4a09a-8b73-4d0e-a888-bec7640f8965","resolution":{"observed_at":"2026-08-04T17:12:41.807926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:41.873309Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:41.873309Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:2c2141429c910bdfd88a579b028c87f633a74f48f6aef5b41bee56073c8b238d","observation_id":"c5bf22d7-432e-45f2-8786-874d6d5015f2","resolution":{"observed_at":"2026-08-04T17:12:41.873309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:41.917428Z","title":"Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:41.917428Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:5ae3dbd250dbfe9448c3433bcc27a7de67e50da6372b3a1af563a73e360e0292","observation_id":"991759fb-2d42-4678-8ba3-50592d5dfc2d","resolution":{"observed_at":"2026-08-04T17:12:41.917428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:41.954996Z","title":"Parallel training of pre-trained models via chunk-based dynamic memory management.IEEE Transactions on Parallel and Distributed Systems, 34(1):304–315, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:41.954996Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:42ea5e41267050ee2b7cfcbc7aed3791976e2060c2f437cffd907b22d9f25faf","observation_id":"2dc67573-48e4-4a10-8800-166503e54001","resolution":{"observed_at":"2026-08-04T17:12:41.954996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:41.998889Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:41.998889Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:fb617f69f74ba36e324fea469a5ce9649797e4e74ac15a388c75c990216557d4","observation_id":"d488a174-db82-432b-a6e4-cbf9d82e8be2","resolution":{"observed_at":"2026-08-04T17:12:41.998889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.073201Z","title":"En- abling parallelism hot switching for efficient training of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.073201Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:ae233d7cdae69ffbbd655c85de77bb51b23566bbe8909c5549e8f3f23d241acd","observation_id":"577d206e-533d-4e19-8552-98d9b477e10d","resolution":{"observed_at":"2026-08-04T17:12:42.073201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-04T17:12:42.079558Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.079558Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:36924b760c10c21ee81dd599a87ec2745be62abff901fb47f1c40df549d610b9","observation_id":"7e734dde-fc62-49af-ac54-bb191f94b410","resolution":{"observed_at":"2026-08-04T17:12:42.079558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.083044Z","title":"Gmlake: Efficient and transparent gpu memory defragmentation for large-scale dnn training with virtual memory stitching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.083044Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:a1793b46763c522bfb7607ea250d2908f050c4f23bce3721646d9169a4e51d7a","observation_id":"1664a8c0-4114-42f1-b40d-291df46e3d21","resolution":{"observed_at":"2026-08-04T17:12:42.083044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.086001Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.086001Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:302fa5fd14dea2a752ceabe11fab8de9836c5c30c5d89ead447b163b4c3f30d5","observation_id":"b24d8825-5e2f-40c8-ae01-4e0cb9ffa612","resolution":{"observed_at":"2026-08-04T17:12:42.086001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.088794Z","title":"Transcending runtime-memory trade- offs in checkpointing by being fusion aware","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.088794Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:a5cc2d5c5808ab7152f9a032f7b98eaa079713f8369cc5bcad53365ee187d440","observation_id":"7f4bbcf7-afd8-4938-b592-9972c2fae70b","resolution":{"observed_at":"2026-08-04T17:12:42.088794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.091653Z","title":"Gpu memory usage optimization for backward propagation in deep network training.Journal of Parallel and Distributed Computing, 199:105053, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.091653Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:71fdd95f3a84151d8180bf4e1ae90e5eb2a4bdf38d750f8b7ae141afb5007630","observation_id":"e70ee0bb-0f6a-43c6-9bc1-d01d03381512","resolution":{"observed_at":"2026-08-04T17:12:42.091653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.094362Z","title":"Meg- taichi: dynamic tensor-based memory management optimization for DNN training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.094362Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:ab39d96c21ed2cd1e801b2b6a425504cd2d67ee61c4443174f30c0d705137e29","observation_id":"ec6e2bc7-2f9e-4af7-acdd-b6a30267b4ad","resolution":{"observed_at":"2026-08-04T17:12:42.094362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.097089Z","title":"Swapadvisor: Pushing deep learning beyond the gpu memory limit via smart swapping","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.097089Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:31b2f79d02b8f273e4401db51f3b35cc4ce4af980fc36639d9ba08eb83bc80c1","observation_id":"17c1bc48-47e6-410a-a885-9293eda36044","resolution":{"observed_at":"2026-08-04T17:12:42.097089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.099977Z","title":"Gpipe: Efficient training of giant neural networks using pipeline parallelism","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.099977Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:155c3f8a23f4cc3825d962535f89c24f620015f47ce8bc7ef49cd6720798cadd","observation_id":"14854789-2eaa-4efe-a6d4-a27db1a2deb8","resolution":{"observed_at":"2026-08-04T17:12:42.099977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.102682Z","title":"Oobleck: Resilient distributed training of large models using pipeline templates","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.102682Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:6a5670027596749b2de39fd02794c3f53ce76278b297c7d0ecf8f48be38243a7","observation_id":"66d0deac-cbf2-48f4-a6f0-546be34848af","resolution":{"observed_at":"2026-08-04T17:12:42.102682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.105477Z","title":"Caffe: Convolutional architecture for fast feature embedding","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.105477Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:90577edee970b023fcd343d5c77cc6bffe521202286365e6ea742db3d4bdda09","observation_id":"8ff79736-8a72-40af-ae55-8c2e55ce3678","resolution":{"observed_at":"2026-08-04T17:12:42.105477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.108218Z","title":"MegaScale: Scaling large language model training to more than 10,000 GPUs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.108218Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:9d37ebfdbf966c932a1e4104e02d2746542e19f7bebe4cb823bcaf2d09a1583e","observation_id":"df975625-0761-4e0f-8c74-8680373070e1","resolution":{"observed_at":"2026-08-04T17:12:42.108218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-04T17:12:42.111023Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.111023Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:0828f5b8b53ae91b1e102423c9b796d33ddd049a22157d0f5ceb1617abcdde96","observation_id":"652e6a8d-12a5-4cb6-883d-3c3082d39e6f","resolution":{"observed_at":"2026-08-04T17:12:42.111023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.114382Z","title":"On model parallelization and scheduling strategies for distributed machine learning","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.114382Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:3f1b996fea66792d9ae1681997e86b53e56ef8f173f265421b274e87561f3879","observation_id":"65947a89-090d-4701-9c62-18e187245652","resolution":{"observed_at":"2026-08-04T17:12:42.114382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.117231Z","title":"Cognitive Intelligence and Robotics","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.117231Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:f6cf75148e6015b40b97308ea405c69d80c529df72efabea7317a4cdee0ded09","observation_id":"5fca8bb7-8ace-43bf-875b-b563b2d02924","resolution":{"observed_at":"2026-08-04T17:12:42.117231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.120255Z","title":"Pytorch distributed: Experiences on accelerating data parallel training.Proc","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.120255Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:f02309d37e1e8efa1cf096d0007fbca4aa43e380fd7c035463a3cc6a55b0a3c3","observation_id":"4d421a1d-4d1e-42bd-8ef1-5a95c2d6bdf6","resolution":{"observed_at":"2026-08-04T17:12:42.120255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.122767Z","title":"Parameter-efficient sparsity for large language models fine-tuning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.122767Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:b2e05bb16cf2f35840738f2ae1b93957b1733d735ad2c74999f435900eecad75","observation_id":"c0c567be-f043-4bf9-887a-a4268ca5874a","resolution":{"observed_at":"2026-08-04T17:12:42.122767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.125207Z","title":"Model compression for deep neural networks: A survey.Computers, 12(3), 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.125207Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:efebf5a3b6ecd6f618ab1739d7c240122ec7c29839e3d8c23da56578822fbe5d","observation_id":"3f0adc43-116f-483a-9fe9-aae4ad391a05","resolution":{"observed_at":"2026-08-04T17:12:42.125207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.128005Z","title":"Ascend: a scalable and unified architecture for ubiquitous deep neural network computing : Industry track paper","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.128005Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:bd2b8ccdd061ed7db656b70cfc662cbd271f53d80e15aab8f39f30ded0f727f2","observation_id":"86ea1121-37cf-41cc-ad4e-653d37d0273c","resolution":{"observed_at":"2026-08-04T17:12:42.128005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.130682Z","title":"Diamos, Erich Elsen, David García, Boris Ginsburg, Michael Houston, Oleksii Kuchaiev, Ganesh Venkatesh, and Hao Wu","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.130682Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:59e476c040303603e736f48168bd3b03076544557da4e66305d9ba3fc455fe83","observation_id":"803c171f-6c55-4eb2-9368-4dd7c474f4cf","resolution":{"observed_at":"2026-08-04T17:12:42.130682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.133182Z","title":"Devanur, Gregory R","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.133182Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:fae61dab8877074b005979c3e93ae8b6c165560a6c125279bb4efcf658c3bbb7","observation_id":"0af72ea8-2d94-41af-8d53-0b3ce91bd13a","resolution":{"observed_at":"2026-08-04T17:12:42.133182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.135758Z","title":"Accessed: 2025-06","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.135758Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:e75208f28758f2de9b9135896e71b830ca0fb3e9260072176bbc1c1f462de4f3","observation_id":"530e2014-7b46-441a-a75d-097e2356a29b","resolution":{"observed_at":"2026-08-04T17:12:42.135758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.138653Z","title":"Accessed: 2025-08","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.138653Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:444005669b36168eac5a6fc1fc949b41ff93085b2bd8fab5e267766732abad81","observation_id":"3d355a5f-310c-4c2c-a5c6-020146ad02d6","resolution":{"observed_at":"2026-08-04T17:12:42.138653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.141103Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.141103Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:145b68a5ec2fd9fa1fb9cdec2c18bb215cfc0f232eb73d80cfe741ea0db529cc","observation_id":"5af6af36-3c22-4e58-8ea6-47c062f99fa0","resolution":{"observed_at":"2026-08-04T17:12:42.141103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.143962Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.143962Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:9a7a45aa341358e505732e543a9ad10f5ef1f0a3a17244a75ce4b4117e653d56","observation_id":"7c057b31-3913-4ae6-a3bb-de4910fa96fc","resolution":{"observed_at":"2026-08-04T17:12:42.143962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.146558Z","title":"Capuchin: Tensor-based gpu memory management for deep learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.146558Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:9193a549205b8dfe26f0b6fe41fb8ce3cdbc00097b7790d4d0815b0ada91f1ec","observation_id":"b97db3e3-59a7-4e66-9ae7-b05b95b51096","resolution":{"observed_at":"2026-08-04T17:12:42.146558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.149293Z","title":"Accessed: 2024-12","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.149293Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:d200085fcae1273015db07041400c0cfedf6f77d4920a468d9b72599c4f50552","observation_id":"4cdb95ca-0b29-46ad-b612-db34d0449ba7","resolution":{"observed_at":"2026-08-04T17:12:42.149293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.151779Z","title":"Accessed: 2024-12","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.151779Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:f49543ca763a6f966023e97b056e75023922db864b9592342895e3f6149108a1","observation_id":"f0127d64-5468-4a1f-aab3-8549765671f7","resolution":{"observed_at":"2026-08-04T17:12:42.151779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.154546Z","title":"Zero: Memory optimizations toward training trillion parameter mod- els","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.154546Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:f62ecf09fc95b6beee4805de798643eca010ac55be650062a2901422c826e1a8","observation_id":"7d504001-4fe5-46bf-90d8-71309c1a96d6","resolution":{"observed_at":"2026-08-04T17:12:42.154546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.157087Z","title":"Zero-infinity: breaking the gpu memory wall for extreme scale deep learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.157087Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:0c2ac1d29c7db4f16c0cecf5a5ec4721b1f35ae7eb88768542aa543d6eeb40c0","observation_id":"24671d30-c663-4185-902b-cf4e76e265dc","resolution":{"observed_at":"2026-08-04T17:12:42.157087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.159700Z","title":"Deepspeed: System optimizations enable training deep learning mod- els with over 100 billion parameters","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.159700Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:4fedec57f2b028cacefca7e2ea609783f8ca210ad6a15ac6c9cb922f81c1a7e1","observation_id":"53cef652-1a4c-4b02-9fa2-3421141fba23","resolution":{"observed_at":"2026-08-04T17:12:42.159700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.162093Z","title":"Sentinel: Efficient tensor migration and allocation on heteroge- neous memory systems for deep learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.162093Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:77f7794d30e10ea2085fcb25d9b69d0437624fe61b09ca3c045c712e4b3627cc","observation_id":"419cae02-0a1a-4773-94b8-b87654d7d60f","resolution":{"observed_at":"2026-08-04T17:12:42.162093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.164630Z","title":"ZeRO-Offload: Democratizing Billion-Scale model training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.164630Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:e986d3a697d66648fa8ae1b0fa7299895a79e33cfaad3994196739300d737215","observation_id":"6b689f6b-2dca-4230-9d7c-9976f561fe33","resolution":{"observed_at":"2026-08-04T17:12:42.164630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.166905Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.166905Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:77dd43b1bfa225e4b808744eba50fc8733d90512caddb41814d7be3e4b9e4191","observation_id":"093ce6c5-fe1c-4f2b-a3c8-896e179120dd","resolution":{"observed_at":"2026-08-04T17:12:42.166905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.169725Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.169725Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:3be5d40dcdca0f7300e50c7465f2ac60b2aec38fdbb3286b62233d7ea3455051","observation_id":"ba47f7de-9267-43e5-a731-1ddbffb5a420","resolution":{"observed_at":"2026-08-04T17:12:42.169725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.172166Z","title":"Cntk: Microsoft’s open-source deep- learning toolkit","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.172166Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:b74894000ac96653ec59fb2a53e2ed42d8820042d5f868ef94958f63f42021da","observation_id":"fd02899f-e2d0-4484-92e4-04d008c6d704","resolution":{"observed_at":"2026-08-04T17:12:42.172166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.174582Z","title":"Neural machine translation of rare words with subword units, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.174582Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:a69e20b02e70b546a80e0a6146469bbfb83fd32c7f9e1956464018e1845116bb","observation_id":"3efdc510-6f06-4b0c-b126-ec89b2d1038c","resolution":{"observed_at":"2026-08-04T17:12:42.174582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-04T17:12:42.177018Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.177018Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:c0025dc9a838c008a231f0ebf93f5668afd74f92ffe804ce3984f91a15d29d86","observation_id":"328f9522-c21b-4049-937f-8db6f5e0747e","resolution":{"observed_at":"2026-08-04T17:12:42.177018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.179849Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.179849Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:da00123db2a5b4d345e51af6a81dcd6c1fd43b9a65da8b8ff87b8a5d0d66f2f2","observation_id":"63e9c211-9b63-49fa-b2d5-cf73a98b25f1","resolution":{"observed_at":"2026-08-04T17:12:42.179849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.182455Z","title":"Bamboo: Making preemptible instances resilient for affordable training of large DNNs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.182455Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:4b2e0c60fd34e5a81fc16c0bdb6324698d7a46d4c15603254e9d469ea47af6ed","observation_id":"d197b74b-c442-4dca-9805-c1495afc1e26","resolution":{"observed_at":"2026-08-04T17:12:42.182455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.185140Z","title":"Superneurons: dynamic gpu memory management for training deep neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.185140Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:efcb4bf6292189b13f7d4ae86e9059dd1f5d98589eb7f8c25d271acbf29e1327","observation_id":"4155000a-7a13-4a9d-8bcf-a9f4bbcfafd3","resolution":{"observed_at":"2026-08-04T17:12:42.185140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.187720Z","title":"Chi, Tatsunori Hashimoto, Oriol Vinyals, Percy Liang, Jeff Dean, and William Fedus","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.187720Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:24dba7956b33bb9165c867a994baa246ef604a5b2df4a70ff7f0458e13b67f00","observation_id":"152ffe27-0bca-4fe3-902c-ff49c1742f05","resolution":{"observed_at":"2026-08-04T17:12:42.187720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.190328Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.190328Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:7ed961912af35839e462962d5954d52965769b2b51e419c7058c4fcbe20740e5","observation_id":"69cc361f-fde4-42be-bfaf-7a27b74d9724","resolution":{"observed_at":"2026-08-04T17:12:42.190328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.192805Z","title":"Accelerating the training of large language models using efficient activation rematerialization and optimal hybrid parallelism","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.192805Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:295655b1830d0ce726ceccd25de27d86288a52063e85176b83cc5c063d43dc92","observation_id":"933fbcee-59db-412d-829e-dd2240db6f7d","resolution":{"observed_at":"2026-08-04T17:12:42.192805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.195329Z","title":"Pytorch fsdp: Experiences on scaling fully sharded data parallel.Proc","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.195329Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:134467b5084f747665e4d84acd06706cf92b0cb04196cd4adb7cfa3e2d4e8370","observation_id":"788b3f30-19de-46ae-bb15-efcf0b91e973","resolution":{"observed_at":"2026-08-04T17:12:42.195329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:12:42.076571Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T17:12:42.076571Z"},"links":{"citing_paper":"/paper/2509.11076"},"observation_digest":"sha256:c0e77d6594b776e2c3dff9e93710219f84ffd74fa8a2843829f4daa1226a7ac4","observation_id":"eae79eea-5b24-4664-adc3-0160a0de8350","resolution":{"observed_at":"2026-08-04T17:12:42.076571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.11076","last_updated":"2026-07-15T13:51:17Z","latest_version":2,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-06T16:58:36.238892Z","submitted_at":"2025-09-14T03:55:03Z","title":"SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":62,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 0 inbound Pith citation observations for arXiv:2509.11076."}