{"as_of":"2026-08-07T07:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1112fc24656ea0b31d513f11c5b88bbeaabddcd7033bbba5f07794b4f39bcf65","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T08:30:57.861433Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-25T05:52:30.402478Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T05:55:24.657761Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"cited_work":{"arxiv_id":"2601.16956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.16956","snapshot_observed_at":"2026-06-29T01:14:28.007359Z","title":"Maurya, M","venue":null,"work_id":"4cbfc9e3-c257-4f34-8924-e265ac8c816a","year":2026},"citing_paper":{"arxiv_id":"2605.11215","last_updated":"2026-05-22T00:14:51Z","snapshot_observed_at":"2026-07-06T23:23:06.755816Z","submitted_at":"2026-05-11T20:28:31Z","title":"ReCoVer: Resilient LLM Pre-Training System via Fault-Tolerant Collective and Versatile Workload","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T01:59:28.408860Z"},"links":{"cited_paper":"/paper/2601.16956","citing_paper":"/paper/2605.11215"},"observation_digest":"sha256:8aa73d4984106a7cc5d481694fdab96a699e86b16a5f3a2b4a487cbcbe13683e","observation_id":"62c009ef-6082-45fa-b036-27c0b91d5df8","resolution":{"observed_at":"2026-06-29T01:14:28.007359Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"cited_work":{"arxiv_id":"2601.16956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.16956","snapshot_observed_at":"2026-06-29T01:14:28.007359Z","title":"Maurya, M","venue":null,"work_id":"4cbfc9e3-c257-4f34-8924-e265ac8c816a","year":2026},"citing_paper":{"arxiv_id":"2605.11215","last_updated":"2026-05-22T00:14:51Z","snapshot_observed_at":"2026-07-06T23:23:06.755816Z","submitted_at":"2026-05-11T20:28:31Z","title":"ReCoVer: Resilient LLM Pre-Training System via Fault-Tolerant Collective and Versatile Workload","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-25T05:52:30.402478Z"},"links":{"cited_paper":"/paper/2601.16956","citing_paper":"/paper/2605.11215"},"observation_digest":"sha256:b01c2b33434fc9cf259ecb16ab64fe9e9805154a94bae3b5b99830c65c4688e2","observation_id":"16ac29bb-b626-4a74-95e5-39a9cdfd2880","resolution":{"observed_at":"2026-06-29T01:14:28.007359Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2601.16956/citation-record","integrity":"/paper/2601.16956/integrity","json":"/paper/2601.16956/citation-record.json","paper":"/paper/2601.16956"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.18864","last_updated":"2025-02-26T06:17:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T06:17:13Z","title":"Towards an AI co-scientist","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18864","snapshot_observed_at":"2026-08-03T08:30:55.044625Z","title":"Towards an ai co-scientist,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:55.044625Z"},"links":{"cited_paper":"/paper/2502.18864","citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:2c09ed8b9dc42b9f2f11f5d3ea93f151287fbd45183a39ff8c7efed21622d720","observation_id":"d605c9a5-7744-434a-be3f-d4ee79ae7a19","resolution":{"observed_at":"2026-08-03T08:30:55.044625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:55.125489Z","title":"Scaling llama 3 training with efficient parallelism strategies,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:55.125489Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:09aa402fe67721b3910c6659d6b31da61bd0640c41d332bab626917394a5b4b2","observation_id":"408b28a6-ed92-4010-a027-ecea474b4c25","resolution":{"observed_at":"2026-08-03T08:30:55.125489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:55.200566Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:55.200566Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:b5146c9507ad606f8d0406ed88404086348e41887143abe6703da96741e4c442","observation_id":"84f44455-5f6d-4334-9f65-ed77f287944e","resolution":{"observed_at":"2026-08-03T08:30:55.200566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:55.281621Z","title":"DeepSpeed: System Optimizations Enable Training Deep Learning Models with Over 100 Billion Parameters,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:55.281621Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:39091650968c5c87522949caf08e401320760bd072d8f5f154ab7c1e3ac98d56","observation_id":"a5a9ef2c-86dc-4768-b88c-c86f9ba68e29","resolution":{"observed_at":"2026-08-03T08:30:55.281621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-03T08:30:55.350781Z","title":"Pytorch fsdp: experiences on scaling fully sharded data parallel,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:55.350781Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:5cfb298050630ceccdfa35286a9897442c9b5fc525cc5c9f22699442356f94fe","observation_id":"92d54919-66cd-4825-a8e5-b7a6181c66e8","resolution":{"observed_at":"2026-08-03T08:30:55.350781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:55.395602Z","title":"Robust llm training infrastructure at bytedance,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:55.395602Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:7bde48b79f35f1883c0ee4437f16be8c114fc639d2af4093bbc05bae4aca09cf","observation_id":"3fa05e02-df14-4849-bd47-c134ef97c201","resolution":{"observed_at":"2026-08-03T08:30:55.395602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:55.469818Z","title":"Unicron: Economizing self-healing llm training at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:55.469818Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:1960c35be812258c7bea15e8b6e21cc72c50cf1ab32fbb63cbd85004f0ed53f9","observation_id":"b2aed746-885f-4953-a74d-4220c88282ac","resolution":{"observed_at":"2026-08-03T08:30:55.469818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16903","last_updated":"2025-07-25T05:09:17Z","snapshot_observed_at":"2026-07-06T17:09:10.513197Z","submitted_at":"2023-12-28T08:53:27Z","title":"Spike No More: Stabilizing the Pre-training of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16903","snapshot_observed_at":"2026-08-03T08:30:55.527546Z","title":"Spike no more: Stabilizing the pre-training of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:55.527546Z"},"links":{"cited_paper":"/paper/2312.16903","citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:6a6e76a712dbb69340066af2a7f1bb669767b37027ead385de2e4852044e14cf","observation_id":"c63a0b42-d534-471a-9761-203a00acd1b7","resolution":{"observed_at":"2026-08-03T08:30:55.527546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13768","last_updated":"2024-06-19T18:31:23Z","snapshot_observed_at":"2026-08-02T06:40:31.748625Z","submitted_at":"2024-06-19T18:31:23Z","title":"FastPersist: Accelerating Model Checkpointing in Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13768","snapshot_observed_at":"2026-08-03T08:30:55.610643Z","title":"Fastpersist: Ac- celerating model checkpointing in deep learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:55.610643Z"},"links":{"cited_paper":"/paper/2406.13768","citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:bb9f71a44304d582b4c8e935dba0f4b77cb4a5c19ed6d59e3bc50c8cf6f33c0e","observation_id":"7fc18c1c-7f90-4ad5-86e0-a9d0a804edd4","resolution":{"observed_at":"2026-08-03T08:30:55.610643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:55.703124Z","title":"Datastates-llm: Lazy asynchronous checkpointing for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:55.703124Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:dc240592292643122151e3d26fa9c374a5bb40ac60a141847122b1963c321ee3","observation_id":"c9f1de20-8b8f-4fbe-b57d-225d92fc3d7a","resolution":{"observed_at":"2026-08-03T08:30:55.703124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:55.778591Z","title":"Welcome to the torchsnapshot documentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:55.778591Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:b9d819fb31d8121e4a2421bc621b3802b1702fe8e37a2c54a43b79685d83c125","observation_id":"51f573d2-766b-4c3b-add4-9a99b71594b4","resolution":{"observed_at":"2026-08-03T08:30:55.778591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:55.871968Z","title":"CheckFreq: Frequent, Fine-Grained DNN checkpointing,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:55.871968Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:b52505b7ae22a9ea89f199f1d59eeb7edbdc4b006b30e272913045eae489e6c9","observation_id":"d28926fd-ef96-4cd1-9080-94b2ae94240b","resolution":{"observed_at":"2026-08-03T08:30:55.871968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:55.919233Z","title":"Gemini: Fast failure recovery in distributed training with in-memory checkpoints,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:55.919233Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:47d71ce849ed7044542bd355511bbb49d592c61a5404fdbf8727e8b5aa4b1144","observation_id":"82835cb8-493f-4363-8f87-5484abfd7394","resolution":{"observed_at":"2026-08-03T08:30:55.919233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:55.983736Z","title":"DeepFreeze: Towards Scalable Asynchronous Checkpointing of Deep Learning Models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:55.983736Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:5cb551a428a7c8df50715e0d48f20637ee830e0cd9213e2cd22a39f699419f62","observation_id":"3c97120e-1d6f-4131-aaff-86f91a5f9f31","resolution":{"observed_at":"2026-08-03T08:30:55.983736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:56.040591Z","title":"Reliable and efficient in-memory fault tolerance of large language model pretraining,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:56.040591Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:c30d96b5c71a13df13ed5209170758bbd04b6cd02cc654043b62789b3c94ddad","observation_id":"8215de6d-c59d-4afb-96cb-00aae19ec539","resolution":{"observed_at":"2026-08-03T08:30:56.040591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:56.096554Z","title":"Optimize Checkpoint Performance for Large Models - Azure Machine Learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:56.096554Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:be9fc540d2c957015ee8b3c97ab48489c7e2544e21becc910771e5a17348f197","observation_id":"ae48085a-f023-4995-a895-81031b58143f","resolution":{"observed_at":"2026-08-03T08:30:56.096554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:56.153666Z","title":"Zero- infinity: breaking the gpu memory wall for extreme scale deep learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:56.153666Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:a7ecca3b352bae4e3ddd54e2746212073a76511cc69c82ae3a151bd129a51a34","observation_id":"06e409a5-02f4-4eb3-8a9a-e9f613a64cea","resolution":{"observed_at":"2026-08-03T08:30:56.153666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:56.254023Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Mod- els Using Model Parallelism,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:56.254023Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:80a663568bbea7ab57a27694b509a5b2019929deec44db3d1bd63bdbbfddb399","observation_id":"8f83c0ba-35da-4f22-b9ca-68e46dc9ae71","resolution":{"observed_at":"2026-08-03T08:30:56.254023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:56.352544Z","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:56.352544Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:105126bfeffad2751a9d0062ad3051bd0063d8c9f593a7e9a337041d982ab642","observation_id":"2ae6e332-9d87-40fa-92a3-2d5207d3e625","resolution":{"observed_at":"2026-08-03T08:30:56.352544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:56.449326Z","title":"Understanding llm checkpoint/restore i/o strategies and patterns,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:56.449326Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:1d67c45a3e0a946c3af549214de23c4bdcdb227869be187c51cd67a1b130aece","observation_id":"e8fde21f-36ea-4ae7-a3df-4345f259b720","resolution":{"observed_at":"2026-08-03T08:30:56.449326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:56.535282Z","title":"A cost-efficient failure-tolerant scheme for distributed dnn training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:56.535282Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:98f7f2d2d33a77b3c65ac0ca04398b4a6f159030dd8d3a85e7ad19fad3b7ffcc","observation_id":"413dc35e-aba8-4037-849b-aba4f18523e6","resolution":{"observed_at":"2026-08-03T08:30:56.535282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:56.597408Z","title":"Transom: An efficient fault-tolerant system for training llms,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:56.597408Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:5d845177542b2e40399c8c37ee17deca1f9ba7a564cc26e353e0ab6a1020176d","observation_id":"347f7a01-18c5-4cd1-9588-62fd6da8892c","resolution":{"observed_at":"2026-08-03T08:30:56.597408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:56.656575Z","title":"Berkeley lab checkpoint/restart (blcr) for linux clusters,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:56.656575Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:80d561d292dcaae0c51bfd12199c7b8fe62a8d573325915cb9eba9a9e03ac092","observation_id":"59c1728f-cd2d-446c-83c7-39cad25b5f66","resolution":{"observed_at":"2026-08-03T08:30:56.656575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:56.740816Z","title":"Checuda: A checkpoint/restart tool for cuda applications,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:56.740816Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:e2f0ca88515c106dbf5a8849f9ede00d629649082cf12d89ceed5a10924422fc","observation_id":"9f7c1e1f-8c4d-400e-a40a-7a66bb9a2c78","resolution":{"observed_at":"2026-08-03T08:30:56.740816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:56.876667Z","title":"VeloC: Towards High Performance Adaptive Asynchronous Check- pointing at Large Scale,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:56.876667Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:a78eacbfa03e24cd7aef8945e434ce93c958009e2147a6884b12132006c03a26","observation_id":"937fca11-d27c-4518-966f-59980c61fac8","resolution":{"observed_at":"2026-08-03T08:30:56.876667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:57.011067Z","title":"Towards Efficient Cache Allocation for High-Frequency Checkpointing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:57.011067Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:90f24d774dc13c4c94ac498f3736f75a87c38ad8f20e171ddc1fe1d4ec00da33","observation_id":"434eb340-2dce-453b-9863-493b5a62673f","resolution":{"observed_at":"2026-08-03T08:30:57.011067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:57.079129Z","title":"GPU-Enabled Asynchronous Multi-level Checkpoint Caching and Prefetching,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:57.079129Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:be7a8067b169687a0f732d27816131117a8ce0147dddb79f817db8e7f23eb1b9","observation_id":"333af9dc-f4cd-434f-b808-ab0fc767a0a6","resolution":{"observed_at":"2026-08-03T08:30:57.079129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:57.142287Z","title":"Checkpoint restart support for heterogeneous hpc applications,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:57.142287Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:a6153edef9ced47c00ae350cb05fa7c118567275de73536d78bf85edf2655a13","observation_id":"1c341511-4424-4445-96bd-507ea5834b8c","resolution":{"observed_at":"2026-08-03T08:30:57.142287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:57.208517Z","title":"Adios 2: The adaptable input output system. a framework for high-performance data management,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:57.208517Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:8c1fcf3c35c7e096053516f8d4af1ee0c6b1ba21ee74f8578695f2c3de16fd85","observation_id":"c72bbc8a-17ef-427d-bc60-a73dc6a72564","resolution":{"observed_at":"2026-08-03T08:30:57.208517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:57.276827Z","title":"An overview of gradient descent optimization algorithms,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:57.276827Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:dd668727d531ceb10dba7870b05273c98d684047e9c8ed9b110072c2a6ed8fb6","observation_id":"e3f0cd8b-0f5c-477d-9128-36a56a691d98","resolution":{"observed_at":"2026-08-03T08:30:57.276827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:57.450739Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:57.450739Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:5b173bb201da18d863e1f18e00dc0fcc528eff5426fc00200f87686db7928a93","observation_id":"4d951ac7-d575-42a4-9883-708b82301d30","resolution":{"observed_at":"2026-08-03T08:30:57.450739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-03T08:30:57.589590Z","title":"Mixed precision training,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:57.589590Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:a2dcb4a52191e7393c9828aa978b98f12cc8bad349e75bbb2265256ada4a9d79","observation_id":"79ac9fa6-930f-436d-9db4-42135a710bbc","resolution":{"observed_at":"2026-08-03T08:30:57.589590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-03T08:30:57.516419Z","title":"Available: https://arxiv.org/abs/1412.6980","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:57.516419Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:c4e2eef4fb0db658222b6419a4a625113a277feb2269127d1a217127c806887f","observation_id":"f47b20f2-689e-457a-a4d7-222ee2868f08","resolution":{"observed_at":"2026-08-03T08:30:57.516419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:57.671452Z","title":"Polaris,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:57.671452Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:ec16f3485bfa839def169c6d9db2ae03cc3430f4a973414cd04bba9b00bc2835","observation_id":"b5726e1c-a469-4c55-9868-aa892988d9a3","resolution":{"observed_at":"2026-08-03T08:30:57.671452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:57.610290Z","title":"Asynccheckpointio– pytorch lightning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:57.610290Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:bc793054c75acccda6e6a3723aef5bb093d45eac0b70fff8cf2230d0a08bca94","observation_id":"bffa5578-05b1-4d36-8146-29c46a95ee6b","resolution":{"observed_at":"2026-08-03T08:30:57.610290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:57.861433Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:57.861433Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:77e20895c0ef97ef4e1da874371e740eb9385cd1c83564dd1f94792269d2b9bf","observation_id":"9d1dde8f-43cb-4a54-85ed-c1e81e725bc8","resolution":{"observed_at":"2026-08-03T08:30:57.861433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:57.769330Z","title":"Lustre: Building a file system for 1000-node clusters,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:57.769330Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:3a8b8f1d5878911497b6da9d997b319e4117eccb5076de3b724ba8938b1adf12","observation_id":"94c7494d-6f77-431b-a8b3-03bfd525090c","resolution":{"observed_at":"2026-08-03T08:30:57.769330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-04T02:05:40.539691Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-03T08:30:57.370717Z","title":"Available: https://arxiv.org/abs/1609.04747","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:57.370717Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:28120efd9f8c2ca7bec975413fbbb9ba54fb13bba894c34a1e01f69d2d52194f","observation_id":"d4d5a879-a7d5-44bc-b7a3-fe72d6472b1c","resolution":{"observed_at":"2026-08-03T08:30:57.370717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 2 inbound Pith citation observations for arXiv:2601.16956."}