Pith. sign in

Paper Citation Record · LEDGER

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences

As of 8 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 0 inbound Pith citation observations for arXiv:2509.11076.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2509.11076 v2

Coverage vector

measured 62 of 62 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-04T17:12:42.195329Z

measured 62 of 62 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

62 of 62 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved62
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 797489cb-11f9-413d-98b5-cfc49ddc171f · outbound

This paper cites Murray, Benoit Steiner, Paul Tucker, Vijay Va- sudevan, Pete Warden, Martin Wicke, Yuan Yu, and Xiaoqiang Zheng.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Murray, Benoit Steiner, Paul Tucker, Vijay Va- sudevan, Pete Warden, Martin Wicke, Yuan Yu, and Xiaoqiang Zheng

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:41.104152Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:41.104152Z digest=sha256:25f52e10c2688a42d0401b2bd9822c5cccf1b4718f6d69830fbddb6ff85724bc

Observation 9f6eb688-5040-446e-94c0-2d7e4ac829ce · outbound

This paper cites Tensorflow eager: A multi-stage, python-embedded dsl for machine learning.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Tensorflow eager: A multi-stage, python-embedded dsl for machine learning

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:41.150813Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:41.150813Z digest=sha256:638d78e484b007a989818ca3e7c5cc6bcae857b49841e145c270adc83e7aaba8

Observation 7a26902c-15f2-4f2b-9a93-0107a2327dde · outbound

This paper cites Accessed: 2024-12.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Accessed: 2024-12

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:41.195175Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:41.195175Z digest=sha256:1597223060d59df3ded4e894eabc936e45ec29d888d188df7b94e6da35734ef3

Observation bc988602-2645-4db1-9e0f-18c3d9c30f3e · outbound

This paper cites an unresolved cited work.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Unresolved cited work

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:41.246379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:41.246379Z digest=sha256:862cce8d0c63e5cc127d6f01becf95e9e68aa9c999f9dd544121faef007c8d19

Observation 00ec6fc1-a5c3-4e06-ab35-60000b2a2eae · outbound

This paper cites Accessed: 2025-06.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Accessed: 2025-06

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:41.297781Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:41.297781Z digest=sha256:27a82e6bf5a6bcf30d23daaa6977ecced42f8d5d2f0229ddf6e844477969000b

Observation 36fd0431-fc20-45f3-8832-33b7e06c7949 · outbound

This paper cites Accessed: 2025-06.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Accessed: 2025-06

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:41.321654Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:41.321654Z digest=sha256:48501d165ce4cb703d88317b279dc5a2d94da03fdb4645a8260d1a7615db3c25

Observation dc0438bf-8698-4d22-8476-b9707d6b137d · outbound

This paper cites Accessed: 2025-08.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Accessed: 2025-08

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:41.433480Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:41.433480Z digest=sha256:f03e1b38d66b945ec21105c34a317a516ccd94b380bb4589fc70ba693ff1fef5

Observation 92711af2-aa84-4f57-9e5b-f9c68b8f4ffc · outbound

This paper cites B, Anshuj Garg, and Purushottam Kulkarni.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences B, Anshuj Garg, and Purushottam Kulkarni

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:41.541213Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:41.541213Z digest=sha256:be7f1ce67edc1fc5b786dfbe00c1114b67cc791640e798c0bfd9682f38920389

Observation ac6b6635-7635-43d9-a051-917d6e76d559 · outbound

This paper cites Qwen2.5-vl technical report, 2025.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Qwen2.5-vl technical report, 2025

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:41.614201Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:41.614201Z digest=sha256:50baaf42d36938780e484293a4542aed009ca341508c96f4adda24d11662b30c

Observation 31ce71fd-f98c-4098-b640-211ffe57b7e9 · outbound

This paper cites CSWAP: A self-tuning compression framework for accelerating tensor swapping in gpus.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences CSWAP: A self-tuning compression framework for accelerating tensor swapping in gpus

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:41.686642Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:41.686642Z digest=sha256:a66267e9369440550c78f43105ae34b199bdbb8da2dd0681ffe252e65b5b99f0

Observation b97bfda7-41b9-4de2-aa49-ad4d51ebbf61 · outbound

This paper cites MXNet: A Flexible and Efficient Machine Learning Library for Heterogeneous Distributed Systems.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences MXNet: A Flexible and Efficient Machine Learning Library for Heterogeneous Distributed Systems

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:41.749621Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:41.749621Z digest=sha256:cac6ee22e54502d64bd4e08783ccf50d94423519a3a76b205ac9cd3f989cad8d

Observation ccc4a09a-8b73-4d0e-a888-bec7640f8965 · outbound

This paper cites Training Deep Nets with Sublinear Memory Cost.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Training Deep Nets with Sublinear Memory Cost

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:41.807926Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:41.807926Z digest=sha256:ac6ee5ed70048585a55a711c71f4fdf8eb7e93c5eba24b87ea4af6b5f1663d3f

Observation c5bf22d7-432e-45f2-8786-874d6d5015f2 · outbound

This paper cites an unresolved cited work.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Unresolved cited work

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:41.873309Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:41.873309Z digest=sha256:2c2141429c910bdfd88a579b028c87f633a74f48f6aef5b41bee56073c8b238d

Observation 991759fb-2d42-4678-8ba3-50592d5dfc2d · outbound

This paper cites Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:41.917428Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:41.917428Z digest=sha256:5ae3dbd250dbfe9448c3433bcc27a7de67e50da6372b3a1af563a73e360e0292

Observation 2dc67573-48e4-4a10-8800-166503e54001 · outbound

This paper cites Parallel training of pre-trained models via chunk-based dynamic memory management.IEEE Transactions on Parallel and Distributed Systems, 34(1):304–315, 2023.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Parallel training of pre-trained models via chunk-based dynamic memory management.IEEE Transactions on Parallel and Distributed Systems, 34(1):304–315, 2023

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:41.954996Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:41.954996Z digest=sha256:42ea5e41267050ee2b7cfcbc7aed3791976e2060c2f437cffd907b22d9f25faf

Observation d488a174-db82-432b-a6e4-cbf9d82e8be2 · outbound

This paper cites Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:41.998889Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:41.998889Z digest=sha256:fb617f69f74ba36e324fea469a5ce9649797e4e74ac15a388c75c990216557d4

Observation 577d206e-533d-4e19-8552-98d9b477e10d · outbound

This paper cites En- abling parallelism hot switching for efficient training of large language models.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences En- abling parallelism hot switching for efficient training of large language models

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.073201Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.073201Z digest=sha256:ae233d7cdae69ffbbd655c85de77bb51b23566bbe8909c5549e8f3f23d241acd

Observation 7e734dde-fc62-49af-ac54-bb191f94b410 · outbound

This paper cites The Llama 3 Herd of Models.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences The Llama 3 Herd of Models

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.079558Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.079558Z digest=sha256:36924b760c10c21ee81dd599a87ec2745be62abff901fb47f1c40df549d610b9

Observation 1664a8c0-4114-42f1-b40d-291df46e3d21 · outbound

This paper cites Gmlake: Efficient and transparent gpu memory defragmentation for large-scale dnn training with virtual memory stitching.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Gmlake: Efficient and transparent gpu memory defragmentation for large-scale dnn training with virtual memory stitching

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.083044Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.083044Z digest=sha256:a1793b46763c522bfb7607ea250d2908f050c4f23bce3721646d9169a4e51d7a

Observation b24d8825-5e2f-40c8-ae01-4e0cb9ffa612 · outbound

This paper cites an unresolved cited work.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Unresolved cited work

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.086001Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.086001Z digest=sha256:302fa5fd14dea2a752ceabe11fab8de9836c5c30c5d89ead447b163b4c3f30d5

Observation 7f4bbcf7-afd8-4938-b592-9972c2fae70b · outbound

This paper cites Transcending runtime-memory trade- offs in checkpointing by being fusion aware.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Transcending runtime-memory trade- offs in checkpointing by being fusion aware

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.088794Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.088794Z digest=sha256:a5cc2d5c5808ab7152f9a032f7b98eaa079713f8369cc5bcad53365ee187d440

Observation e70ee0bb-0f6a-43c6-9bc1-d01d03381512 · outbound

This paper cites Gpu memory usage optimization for backward propagation in deep network training.Journal of Parallel and Distributed Computing, 199:105053, 2025.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Gpu memory usage optimization for backward propagation in deep network training.Journal of Parallel and Distributed Computing, 199:105053, 2025

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.091653Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.091653Z digest=sha256:71fdd95f3a84151d8180bf4e1ae90e5eb2a4bdf38d750f8b7ae141afb5007630

Observation ec6e2bc7-2f9e-4af7-acdd-b6a30267b4ad · outbound

This paper cites Meg- taichi: dynamic tensor-based memory management optimization for DNN training.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Meg- taichi: dynamic tensor-based memory management optimization for DNN training

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.094362Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.094362Z digest=sha256:ab39d96c21ed2cd1e801b2b6a425504cd2d67ee61c4443174f30c0d705137e29

Observation 17c1bc48-47e6-410a-a885-9293eda36044 · outbound

This paper cites Swapadvisor: Pushing deep learning beyond the gpu memory limit via smart swapping.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Swapadvisor: Pushing deep learning beyond the gpu memory limit via smart swapping

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.097089Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.097089Z digest=sha256:31b2f79d02b8f273e4401db51f3b35cc4ce4af980fc36639d9ba08eb83bc80c1

Observation 14854789-2eaa-4efe-a6d4-a27db1a2deb8 · outbound

This paper cites Gpipe: Efficient training of giant neural networks using pipeline parallelism.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Gpipe: Efficient training of giant neural networks using pipeline parallelism

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.099977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.099977Z digest=sha256:155c3f8a23f4cc3825d962535f89c24f620015f47ce8bc7ef49cd6720798cadd

Observation 66d0deac-cbf2-48f4-a6f0-546be34848af · outbound

This paper cites Oobleck: Resilient distributed training of large models using pipeline templates.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Oobleck: Resilient distributed training of large models using pipeline templates

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.102682Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.102682Z digest=sha256:6a5670027596749b2de39fd02794c3f53ce76278b297c7d0ecf8f48be38243a7

Observation 8ff79736-8a72-40af-ae55-8c2e55ce3678 · outbound

This paper cites Caffe: Convolutional architecture for fast feature embedding.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Caffe: Convolutional architecture for fast feature embedding

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.105477Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.105477Z digest=sha256:90577edee970b023fcd343d5c77cc6bffe521202286365e6ea742db3d4bdda09

Observation df975625-0761-4e0f-8c74-8680373070e1 · outbound

This paper cites MegaScale: Scaling large language model training to more than 10,000 GPUs.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences MegaScale: Scaling large language model training to more than 10,000 GPUs

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.108218Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.108218Z digest=sha256:9d37ebfdbf966c932a1e4104e02d2746542e19f7bebe4cb823bcaf2d09a1583e

Observation 652e6a8d-12a5-4cb6-883d-3c3082d39e6f · outbound

This paper cites Scaling Laws for Neural Language Models.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Scaling Laws for Neural Language Models

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.111023Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.111023Z digest=sha256:0828f5b8b53ae91b1e102423c9b796d33ddd049a22157d0f5ceb1617abcdde96

Observation 65947a89-090d-4701-9c62-18e187245652 · outbound

This paper cites On model parallelization and scheduling strategies for distributed machine learning.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences On model parallelization and scheduling strategies for distributed machine learning

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.114382Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.114382Z digest=sha256:3f1b996fea66792d9ae1681997e86b53e56ef8f173f265421b274e87561f3879

Observation 5fca8bb7-8ace-43bf-875b-b563b2d02924 · outbound

This paper cites Cognitive Intelligence and Robotics.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Cognitive Intelligence and Robotics

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.117231Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.117231Z digest=sha256:f6cf75148e6015b40b97308ea405c69d80c529df72efabea7317a4cdee0ded09

Observation 4d421a1d-4d1e-42bd-8ef1-5a95c2d6bdf6 · outbound

This paper cites Pytorch distributed: Experiences on accelerating data parallel training.Proc.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Pytorch distributed: Experiences on accelerating data parallel training.Proc

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.120255Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.120255Z digest=sha256:f02309d37e1e8efa1cf096d0007fbca4aa43e380fd7c035463a3cc6a55b0a3c3

Observation c0c567be-f043-4bf9-887a-a4268ca5874a · outbound

This paper cites Parameter-efficient sparsity for large language models fine-tuning.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Parameter-efficient sparsity for large language models fine-tuning

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.122767Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.122767Z digest=sha256:b2e05bb16cf2f35840738f2ae1b93957b1733d735ad2c74999f435900eecad75

Observation 3f0adc43-116f-483a-9fe9-aae4ad391a05 · outbound

This paper cites Model compression for deep neural networks: A survey.Computers, 12(3), 2023.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Model compression for deep neural networks: A survey.Computers, 12(3), 2023

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.125207Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.125207Z digest=sha256:efebf5a3b6ecd6f618ab1739d7c240122ec7c29839e3d8c23da56578822fbe5d

Observation 86ea1121-37cf-41cc-ad4e-653d37d0273c · outbound

This paper cites Ascend: a scalable and unified architecture for ubiquitous deep neural network computing : Industry track paper.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Ascend: a scalable and unified architecture for ubiquitous deep neural network computing : Industry track paper

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.128005Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.128005Z digest=sha256:bd2b8ccdd061ed7db656b70cfc662cbd271f53d80e15aab8f39f30ded0f727f2

Observation 803c171f-6c55-4eb2-9368-4dd7c474f4cf · outbound

This paper cites Diamos, Erich Elsen, David García, Boris Ginsburg, Michael Houston, Oleksii Kuchaiev, Ganesh Venkatesh, and Hao Wu.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Diamos, Erich Elsen, David García, Boris Ginsburg, Michael Houston, Oleksii Kuchaiev, Ganesh Venkatesh, and Hao Wu

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.130682Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.130682Z digest=sha256:59e476c040303603e736f48168bd3b03076544557da4e66305d9ba3fc455fe83

Observation 0af72ea8-2d94-41af-8d53-0b3ce91bd13a · outbound

This paper cites Devanur, Gregory R.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Devanur, Gregory R

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.133182Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.133182Z digest=sha256:fae61dab8877074b005979c3e93ae8b6c165560a6c125279bb4efcf658c3bbb7

Observation 530e2014-7b46-441a-a75d-097e2356a29b · outbound

This paper cites Accessed: 2025-06.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Accessed: 2025-06

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.135758Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.135758Z digest=sha256:e75208f28758f2de9b9135896e71b830ca0fb3e9260072176bbc1c1f462de4f3

Observation 3d355a5f-310c-4c2c-a5c6-020146ad02d6 · outbound

This paper cites Accessed: 2025-08.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Accessed: 2025-08

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.138653Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.138653Z digest=sha256:444005669b36168eac5a6fc1fc949b41ff93085b2bd8fab5e267766732abad81

Observation 5af6af36-3c22-4e58-8ea6-47c062f99fa0 · outbound

This paper cites an unresolved cited work.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Unresolved cited work

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.141103Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.141103Z digest=sha256:145b68a5ec2fd9fa1fb9cdec2c18bb215cfc0f232eb73d80cfe741ea0db529cc

Observation 7c057b31-3913-4ae6-a3bb-de4910fa96fc · outbound

This paper cites Pytorch: An imperative style, high-performance deep learning library.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Pytorch: An imperative style, high-performance deep learning library

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.143962Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.143962Z digest=sha256:9a7a45aa341358e505732e543a9ad10f5ef1f0a3a17244a75ce4b4117e653d56

Observation b97db3e3-59a7-4e66-9ae7-b05b95b51096 · outbound

This paper cites Capuchin: Tensor-based gpu memory management for deep learning.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Capuchin: Tensor-based gpu memory management for deep learning

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.146558Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.146558Z digest=sha256:9193a549205b8dfe26f0b6fe41fb8ce3cdbc00097b7790d4d0815b0ada91f1ec

Observation 4cdb95ca-0b29-46ad-b612-db34d0449ba7 · outbound

This paper cites Accessed: 2024-12.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Accessed: 2024-12

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.149293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.149293Z digest=sha256:d200085fcae1273015db07041400c0cfedf6f77d4920a468d9b72599c4f50552

Observation f0127d64-5468-4a1f-aab3-8549765671f7 · outbound

This paper cites Accessed: 2024-12.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Accessed: 2024-12

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.151779Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.151779Z digest=sha256:f49543ca763a6f966023e97b056e75023922db864b9592342895e3f6149108a1

Observation 7d504001-4fe5-46bf-90d8-71309c1a96d6 · outbound

This paper cites Zero: Memory optimizations toward training trillion parameter mod- els.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Zero: Memory optimizations toward training trillion parameter mod- els

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.154546Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.154546Z digest=sha256:f62ecf09fc95b6beee4805de798643eca010ac55be650062a2901422c826e1a8

Observation 24671d30-c663-4185-902b-cf4e76e265dc · outbound

This paper cites Zero-infinity: breaking the gpu memory wall for extreme scale deep learning.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Zero-infinity: breaking the gpu memory wall for extreme scale deep learning

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.157087Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.157087Z digest=sha256:0c2ac1d29c7db4f16c0cecf5a5ec4721b1f35ae7eb88768542aa543d6eeb40c0

Observation 53cef652-1a4c-4b02-9fa2-3421141fba23 · outbound

This paper cites Deepspeed: System optimizations enable training deep learning mod- els with over 100 billion parameters.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Deepspeed: System optimizations enable training deep learning mod- els with over 100 billion parameters

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.159700Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.159700Z digest=sha256:4fedec57f2b028cacefca7e2ea609783f8ca210ad6a15ac6c9cb922f81c1a7e1

Observation 419cae02-0a1a-4773-94b8-b87654d7d60f · outbound

This paper cites Sentinel: Efficient tensor migration and allocation on heteroge- neous memory systems for deep learning.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Sentinel: Efficient tensor migration and allocation on heteroge- neous memory systems for deep learning

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.162093Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.162093Z digest=sha256:77f7794d30e10ea2085fcb25d9b69d0437624fe61b09ca3c045c712e4b3627cc

Observation 6b689f6b-2dca-4230-9d7c-9976f561fe33 · outbound

This paper cites ZeRO-Offload: Democratizing Billion-Scale model training.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences ZeRO-Offload: Democratizing Billion-Scale model training

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.164630Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.164630Z digest=sha256:e986d3a697d66648fa8ae1b0fa7299895a79e33cfaad3994196739300d737215

Observation 093ce6c5-fe1c-4f2b-a3c8-896e179120dd · outbound

This paper cites an unresolved cited work.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Unresolved cited work

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.166905Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.166905Z digest=sha256:77dd43b1bfa225e4b808744eba50fc8733d90512caddb41814d7be3e4b9e4191

Observation ba47f7de-9267-43e5-a731-1ddbffb5a420 · outbound

This paper cites an unresolved cited work.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Unresolved cited work

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.169725Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.169725Z digest=sha256:3be5d40dcdca0f7300e50c7465f2ac60b2aec38fdbb3286b62233d7ea3455051

Observation fd02899f-e2d0-4484-92e4-04d008c6d704 · outbound

This paper cites Cntk: Microsoft’s open-source deep- learning toolkit.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Cntk: Microsoft’s open-source deep- learning toolkit

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.172166Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.172166Z digest=sha256:b74894000ac96653ec59fb2a53e2ed42d8820042d5f868ef94958f63f42021da

Observation 3efdc510-6f06-4b0c-b126-ec89b2d1038c · outbound

This paper cites Neural machine translation of rare words with subword units, 2016.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Neural machine translation of rare words with subword units, 2016

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.174582Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.174582Z digest=sha256:a69e20b02e70b546a80e0a6146469bbfb83fd32c7f9e1956464018e1845116bb

Observation 328f9522-c21b-4049-937f-8db6f5e0747e · outbound

This paper cites Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.177018Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.177018Z digest=sha256:c0025dc9a838c008a231f0ebf93f5668afd74f92ffe804ce3984f91a15d29d86

Observation 63e9c211-9b63-49fa-b2d5-cf73a98b25f1 · outbound

This paper cites an unresolved cited work.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Unresolved cited work

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.179849Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.179849Z digest=sha256:da00123db2a5b4d345e51af6a81dcd6c1fd43b9a65da8b8ff87b8a5d0d66f2f2

Observation d197b74b-c442-4dca-9805-c1495afc1e26 · outbound

This paper cites Bamboo: Making preemptible instances resilient for affordable training of large DNNs.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Bamboo: Making preemptible instances resilient for affordable training of large DNNs

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.182455Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.182455Z digest=sha256:4b2e0c60fd34e5a81fc16c0bdb6324698d7a46d4c15603254e9d469ea47af6ed

Observation 4155000a-7a13-4a9d-8bcf-a9f4bbcfafd3 · outbound

This paper cites Superneurons: dynamic gpu memory management for training deep neural networks.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Superneurons: dynamic gpu memory management for training deep neural networks

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.185140Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.185140Z digest=sha256:efcb4bf6292189b13f7d4ae86e9059dd1f5d98589eb7f8c25d271acbf29e1327

Observation 152ffe27-0bca-4fe3-902c-ff49c1742f05 · outbound

This paper cites Chi, Tatsunori Hashimoto, Oriol Vinyals, Percy Liang, Jeff Dean, and William Fedus.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Chi, Tatsunori Hashimoto, Oriol Vinyals, Percy Liang, Jeff Dean, and William Fedus

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.187720Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.187720Z digest=sha256:24dba7956b33bb9165c867a994baa246ef604a5b2df4a70ff7f0458e13b67f00

Observation 69cc361f-fde4-42be-bfaf-7a27b74d9724 · outbound

This paper cites an unresolved cited work.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Unresolved cited work

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.190328Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.190328Z digest=sha256:7ed961912af35839e462962d5954d52965769b2b51e419c7058c4fcbe20740e5

Observation 933fbcee-59db-412d-829e-dd2240db6f7d · outbound

This paper cites Accelerating the training of large language models using efficient activation rematerialization and optimal hybrid parallelism.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Accelerating the training of large language models using efficient activation rematerialization and optimal hybrid parallelism

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.192805Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.192805Z digest=sha256:295655b1830d0ce726ceccd25de27d86288a52063e85176b83cc5c063d43dc92

Observation 788b3f30-19de-46ae-bb15-efcf0b91e973 · outbound

This paper cites Pytorch fsdp: Experiences on scaling fully sharded data parallel.Proc.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Pytorch fsdp: Experiences on scaling fully sharded data parallel.Proc

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.195329Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.195329Z digest=sha256:134467b5084f747665e4d84acd06706cf92b0cb04196cd4adb7cfa3e2d4e8370

Observation eae79eea-5b24-4664-adc3-0160a0de8350 · outbound

This paper cites an unresolved cited work.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Unresolved cited work

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.076571Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.076571Z digest=sha256:c0e77d6594b776e2c3dff9e93710219f84ffd74fa8a2843829f4daa1226a7ac4

Pith citing papers

No inbound Pith citation observations are available.