{"as_of":"2026-08-09T03:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:63f48b793bb8338b7e63558a498d6716f29d1bd74cebb026d3a31955ad0a87d5","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T10:20:02.783216Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.08145/citation-record","integrity":"/paper/2502.08145/integrity","json":"/paper/2502.08145/citation-record.json","paper":"/paper/2502.08145"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.273723Z","title":"Super: Sub-graph parallelism for transformers,","venue":null,"work_id":"406d0300-1193-48c6-b41c-2cf864ef3395","year":2021},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.624115Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:8b21b5467cc45da074c7f78cbe0889e0e625bee089a4f197b87616bbfe5be5d1","observation_id":"cfe60ddb-b8d2-4770-b176-54ab30e9e410","resolution":{"observed_at":"2026-08-08T10:20:05.277436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.266051Z","title":"Scaling distributed deep learning work- loads beyond the memory capacity with karma,","venue":null,"work_id":"e089d0dd-cd90-4d41-9b36-e4cf564c8c6c","year":2020},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.628041Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:c1d74b86ec14b0b86ed5c6f52b327f36b1015e9c91126cf4bdfb7159b5d361de","observation_id":"e6e52360-d80b-4c1f-a0da-591463fe3c47","resolution":{"observed_at":"2026-08-08T10:20:05.268993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.258122Z","title":"Forge: Pre-training open foundation models for science,","venue":null,"work_id":"f93efd24-ee2e-4b16-af2d-fc584ac93ef4","year":2023},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.631258Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:537e0bd86d7f8d15f7a8564d18798430082fc47c00d1fbf4ed8e8a1e17065574","observation_id":"173818ab-a30e-46b0-8e04-3a0b664a992f","resolution":{"observed_at":"2026-08-08T10:20:05.261411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.248839Z","title":"Optimizing distributed training on frontier for large language models,","venue":null,"work_id":"7168a576-6d7b-4b2c-b3b6-21e09c35bde5","year":2024},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.634237Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:987bf83693b2038975dbe59ebccd0551501bf49a49eaad68ea800d3bafbc1d79","observation_id":"05f24982-92c5-4040-a46f-8d80de8a20a7","resolution":{"observed_at":"2026-08-08T10:20:05.251706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.239773Z","title":"Using deepspeed and megatron to train megatron-turing nlg 530b, a large-scale generative language model,","venue":null,"work_id":"21db730a-f7d5-41a8-abfb-c8fccf748075","year":2022},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.638603Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:879be5150c6e747a86df4fc848e5fc4852906abc739342291fb461e3b303098e","observation_id":"ae7568c9-1fd7-465d-8c55-ee1c7922a044","resolution":{"observed_at":"2026-08-08T10:20:05.242863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-08T01:15:17.906950Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-08T10:20:02.642128Z","title":"Efficient large-scale language model training on GPU clusters,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.642128Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:a6200d1aee183845070a555fb3460e1a90f117073439c119362ee9652ea90e71","observation_id":"fb0670d6-8efc-4d2e-b247-9226f418704c","resolution":{"observed_at":"2026-08-08T10:20:02.642128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.231069Z","title":"MegaScale: Scaling large language model training to more than 10,000 GPUs,","venue":null,"work_id":"f20c8294-e23b-4830-9ccb-c4eec834466c","year":2024},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.645980Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:413bf175ed3346c87a8e7f8f9c9340f214a1282c0098b0c1a8c0d5d5af2d16d6","observation_id":"e5e73c07-1c20-43a9-b9c3-b2cccfb97aa8","resolution":{"observed_at":"2026-08-08T10:20:05.234090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.221471Z","title":"Google cloud demonstrates the world’s largest distributed training job for large language models across 50000+ tpu v5e chips,","venue":null,"work_id":"66e1875c-8ffb-4433-9e4f-012d36d378d6","year":null},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.649415Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:8a17fd93c0b125d9cd4acc93f679ba4619dd2bec2fc3f0a3cd5386808f118c25","observation_id":"5fb685db-f7b6-4a83-b6f5-0fb09d67e5db","resolution":{"observed_at":"2026-08-08T10:20:05.224647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.212704Z","title":"AxoNN: An asynchronous, message-driven parallel framework for extreme-scale deep learning,","venue":null,"work_id":"cf7d2f77-d907-4093-bd48-f6b10bc839b4","year":2022},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.652845Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:f0f99e1ae0d80524170cf8b3317ded3449da1b17db1bbb98dc3ae505535c58f2","observation_id":"d31439de-b84f-43b5-ab93-7aff0e022af2","resolution":{"observed_at":"2026-08-08T10:20:05.215715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:04.952781Z","title":"Exploiting sparsity in pruned neural networks to optimize large model training,","venue":null,"work_id":"adc9a204-1f10-4970-9235-42125bc8d36e","year":2023},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.655642Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:ef8888580335f1fc9fc5ac0378b6947a51a45687f38f359f0842f87029baf94a","observation_id":"34d2b012-dcf0-4de7-9aac-58efaec82c63","resolution":{"observed_at":"2026-08-08T10:20:04.956493Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.203265Z","title":"Zero: Memory optimizations toward training trillion parameter models,","venue":null,"work_id":"0ab48153-9043-431e-9416-af7d425f92d1","year":2020},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.659372Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:4914a2974585538af735172053a4e36ea86c14cb513db51ca5a107d4d5316b50","observation_id":"92cc03c1-322f-49ff-9c7e-96cfae54dcd9","resolution":{"observed_at":"2026-08-08T10:20:05.206332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.193981Z","title":"Pytorch fsdp: Experiences on scaling fully sharded data parallel,","venue":null,"work_id":"580438e4-8870-44d7-8f9c-93bea637b829","year":2023},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.662349Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:408f7c3e269cf6974c6a737e4b17a488fa4070fb1a7330d8dc0976bf111200ca","observation_id":"15d514db-84c9-449c-8c4d-b2e5864ee6fd","resolution":{"observed_at":"2026-08-08T10:20:05.197454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.175570Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism,","venue":null,"work_id":"ede2d737-91e8-4b51-9225-dd8b954ed35f","year":2020},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.668560Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:22048e7036935baab28033fc8700397d0dad1c61c6367047f05354a5998a7267","observation_id":"3adfc4b9-0a73-4fa5-ad42-26269b8f8431","resolution":{"observed_at":"2026-08-08T10:20:05.179145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.167566Z","title":"GPipe: efficient training of giant neural networks using pipeline parallelism,","venue":null,"work_id":"9bfdc574-5256-4ef8-baa0-0de87d108cf1","year":2019},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.671345Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:21722001bdca679227488eb77658e28769363877bebfe90217105a43f7198b71","observation_id":"a4b70986-2b49-46e6-8dc1-4fe17fee7aca","resolution":{"observed_at":"2026-08-08T10:20:05.170498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.159048Z","title":"Deepspeed: Extreme-scale model training for everyone,","venue":null,"work_id":"31146221-abca-4532-ae3e-1c55569322be","year":null},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.674012Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:808d574c3e10b7684f1ff7f0de124a579f4edcca146bc38e41a8f5e4999a12e5","observation_id":"d1a34e15-d91d-4c5d-9bd6-52060981d60c","resolution":{"observed_at":"2026-08-08T10:20:05.162555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:04.605011Z","title":"A hybrid tensor-expert-data parallelism approach to optimize mixture-of-experts training,","venue":null,"work_id":"da0b5c67-57d5-4ece-ae27-edde24f52a50","year":2023},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.677289Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:29e06e339a9d0786f69b7af5a8edb315a083f710c376b83fd2e67d38c3b1bc2f","observation_id":"e8091f37-6dfe-4fa1-8251-e0e7012908a5","resolution":{"observed_at":"2026-08-08T10:20:04.609477Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.149234Z","title":"GPT-NeoX: Large Scale Autoregressive Language Modeling in PyTorch,","venue":null,"work_id":"7c51769b-500b-47ba-a9bd-5878602042e3","year":2023},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.680393Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:297503cf534a9e56d30624e7ef81db8109a391ebcdc084c25b1b1720caab16d3","observation_id":"1dc7ce9b-2044-4557-8c17-4858138b72d0","resolution":{"observed_at":"2026-08-08T10:20:05.152654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12023","last_updated":"2022-06-28T19:36:44Z","snapshot_observed_at":"2026-08-07T05:15:09.810779Z","submitted_at":"2022-01-28T10:13:35Z","title":"Alpa: Automating Inter- and Intra-Operator Parallelism for Distributed Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12023","snapshot_observed_at":"2026-08-08T10:20:02.683674Z","title":"Alpa: Automating inter- and intra-operator parallelism for distributed deep learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.683674Z"},"links":{"cited_paper":"/paper/2201.12023","citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:62ea52c625b6bcb6945c28f336b4edac0586f636b8a99e736dc224c47308eecd","observation_id":"2a4c607d-2d59-4ad5-aba4-f0ec474863d6","resolution":{"observed_at":"2026-08-08T10:20:02.683674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.140984Z","title":"Colossal-AI: a unified deep learning system for large-scale parallel training,","venue":null,"work_id":"0189db92-2bc8-43a6-a7ca-19a2ae3fb873","year":2023},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.686844Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:09fca981bc4a32910cfee132398e191687f844bac027345c7d46af2188c2b323","observation_id":"6f350aae-1cf5-48ed-b4fd-71628a22086c","resolution":{"observed_at":"2026-08-08T10:20:05.144149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.130824Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":"849f33fa-96a4-4adb-af70-3a163c8e3a19","year":2023},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.689764Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:af118bbefe7fc5057db734bda9ed5895ef2b210191d116bc1467e16e5dbca967","observation_id":"8854f878-52af-44af-9404-6ff66b5a0ad9","resolution":{"observed_at":"2026-08-08T10:20:05.133794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10683","last_updated":"2023-09-19T15:14:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-23T17:37:36Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10683","snapshot_observed_at":"2026-08-08T10:20:02.692885Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.692885Z"},"links":{"cited_paper":"/paper/1910.10683","citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:5072ee35775a91d17e561b479c3d7af1a64a3fcf3a0fd477d6cfdfd09e83d060","observation_id":"8b3f9544-2386-40d4-9509-223cf5ea0c6e","resolution":{"observed_at":"2026-08-08T10:20:02.692885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.122578Z","title":"LBANN: livermore big artificial neural network HPC toolkit,","venue":null,"work_id":"aeeb8dfc-5c43-4d73-8ac6-a55939a3e794","year":2015},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.696500Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:690be92af7405bb218109127df6e34cb7ace2afac6d8fa0690f335e128e6c1eb","observation_id":"9ba13cb0-3cdc-4355-a15a-12751caef3c7","resolution":{"observed_at":"2026-08-08T10:20:05.125390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.114023Z","title":"Nvidia selene supercomputer,","venue":null,"work_id":"c9303df8-cb98-4053-8c40-8322b93c667a","year":null},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.699888Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:aaf155a25ab2da7cfb4ec51e1d899a77baf09672b34078c78008326bd2e4d346","observation_id":"bfd7db8b-9d6c-4dd3-bd2e-e40fcaf5ce0d","resolution":{"observed_at":"2026-08-08T10:20:05.117015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.106063Z","title":"Frontier: Exploring exascale,","venue":null,"work_id":"884e8802-b344-4b94-97f2-fbde894419e9","year":2023},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.703399Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:be90b0a3be28a814e41d1115bd68e20bb2189a0b961239ff18eb3f11682ab5f1","observation_id":"d6c41d50-7547-4753-9b5c-04cfec9da0fd","resolution":{"observed_at":"2026-08-08T10:20:05.108866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.097213Z","title":"A three-dimensional approach to parallel matrix multiplication,","venue":null,"work_id":"36522df2-82f8-4281-8450-733f74d3d96e","year":1995},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.706230Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:734d022aa29ab232ee97dd24a8f619dd6ed9024739a056ff9f6faedc8426e871","observation_id":"02f325f9-583f-4c53-9893-f82b4e765e40","resolution":{"observed_at":"2026-08-08T10:20:05.100532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.185423Z","title":"ZeRO++: Extremely efficient collective communication for large model training,","venue":null,"work_id":"96b06754-4ba8-438d-9315-bdf10dd50c2c","year":2024},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.709021Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:1e01e96b74b20f5252c39ffa7e12d46c1865c4f975ca81a694c797c5fe73f0ef","observation_id":"38b79e32-95e6-49cb-a25c-afe97b3a2065","resolution":{"observed_at":"2026-08-08T10:20:05.188445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.087778Z","title":"Improving the performance of collective operations in mpich,","venue":null,"work_id":"ab6e8d52-c5f7-47c4-a8d9-9409a149d534","year":2003},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.712838Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:0af127c51fe147a9419605eb31de1117d66611117d6862ad249211ca15aed2f1","observation_id":"fb5c813e-084a-4de4-9796-71e62a58cd82","resolution":{"observed_at":"2026-08-08T10:20:05.091221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.079550Z","title":"Optimization of collective reduction operations,","venue":null,"work_id":"5bbef7d6-b6d3-4965-a34e-ea9f4bebf2a2","year":2004},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.715458Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:bfc2bacc9994160c24fd38e2cfd8501fab6f2a2124473bf66cdeb632d46d3ba3","observation_id":"961544f7-2ae5-40f2-877b-6060c90bdeb0","resolution":{"observed_at":"2026-08-08T10:20:05.082585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:03.297713Z","title":"Improving communication performance in dense linear algebra via topology aware collectives,","venue":null,"work_id":"3f2f7c50-4324-4fa2-9f99-656a1094a174","year":2011},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.718427Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:1e0441668b17ce4246a52895fde11a917a726f217e64e5be55076038e6d4cd86","observation_id":"027f16fe-75f9-4c37-b9be-d0606c3646e4","resolution":{"observed_at":"2026-08-08T10:20:03.301128Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/sc.20","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:02.816545Z","title":"Mapping applications with collectives over sub-communicators on torus networks,","venue":null,"work_id":"616187f3-b96d-466a-b6f2-15a26cee2f09","year":2012},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.721918Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:da246453a4623421622cb85c0479a2016a07b3422c421ff87f94a2cbbfbb2a3f","observation_id":"2856382c-b8dc-419c-9ece-b2bb727d5dbb","resolution":{"observed_at":"2026-08-08T10:20:02.820258Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/sc.2014.32","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:02.803946Z","title":"RAHTM: Routing- algorithm aware hierarchical task mapping,","venue":null,"work_id":"101171f1-c3fe-43c1-8d99-375dbdadadca","year":2014},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.725877Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:102af208158123a8041cb7425b5a4ca0bdbd9b9daba373aee36f064e226ed7e3","observation_id":"ffae8d80-2e29-432e-8d87-6220294e365e","resolution":{"observed_at":"2026-08-08T10:20:02.809304Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:03.044532Z","title":"Optimizing the performance of parallel applications on a 5D torus via task mapping,","venue":null,"work_id":"798f61bb-6add-49f7-88b9-1b7df5a357f3","year":2014},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.728858Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:cdd93b7b897dbe9dc963632037f755aea80304678c6b6edd10b7e9a42cf2948c","observation_id":"18f394f7-eb24-445c-80cb-9b33769fb30e","resolution":{"observed_at":"2026-08-08T10:20:03.048400Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.070607Z","title":"Supervised learning based algorithm selection for deep neural networks,","venue":null,"work_id":"23d072e4-eccb-425c-8db4-46bc2b9c0748","year":2017},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.732776Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:6ee956858949b988792990873bf78f8ba750c5d442b83e767bb04e98882119dc","observation_id":"fa8248a8-893e-42fb-8106-6fa3d1da566c","resolution":{"observed_at":"2026-08-08T10:20:05.073494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-08T10:20:02.735880Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.735880Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:a312a340ffbbf5e4088cc015153a02cb740dd3aa1fb80f34ce0ec1cee7d4280c","observation_id":"bcbddde1-a435-4540-98b6-c815a313d1fd","resolution":{"observed_at":"2026-08-08T10:20:02.735880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-08T10:20:02.739697Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.739697Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:cb2cb2c4b32f56637c10de40d3288666966b0cc8c830fe56de5de8c7adda7950","observation_id":"25f95a0b-c2c5-408b-85ae-6bb5b9478acc","resolution":{"observed_at":"2026-08-08T10:20:02.739697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.061762Z","title":"Bigscience large open-science open-access multilingual language model,","venue":null,"work_id":"21af213c-e0fe-4a22-be38-59623337fd2b","year":2022},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.742736Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:1c45691a2c9016775b6d0663f2a2f49d2798386976ad5dc16f1a750997951c44","observation_id":"b6d68b7c-b16a-48b5-9784-ea7c3494d9d0","resolution":{"observed_at":"2026-08-08T10:20:05.065419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.052768Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":"634ea8e1-dd12-48b4-a643-6321f01a5b5b","year":2019},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.746066Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:a417821051a5e91f364b349787bb9a6cba3fc8989dc8d6e111383e9774c10f1e","observation_id":"9a5e2c51-0a27-4a59-85c6-11fea84bdb77","resolution":{"observed_at":"2026-08-08T10:20:05.056115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1604.06174","last_updated":"2016-04-22T19:21:36Z","snapshot_observed_at":"2026-08-08T09:03:25.135475Z","submitted_at":"2016-04-21T04:15:27Z","title":"Training Deep Nets with Sublinear Memory Cost","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.06174","snapshot_observed_at":"2026-08-08T10:20:02.748714Z","title":"Training deep nets with sublinear memory cost,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.748714Z"},"links":{"cited_paper":"/paper/1604.06174","citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:110bab1bd8b15fd98dfacff9eaea4e49ea10e9bfd3792cf26975912ab99e2f6d","observation_id":"3a6163ec-71d9-4a64-9421-e53764fd4d5f","resolution":{"observed_at":"2026-08-08T10:20:02.748714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.12322","last_updated":"2019-06-13T17:55:30Z","snapshot_observed_at":"2026-08-04T04:17:53.148033Z","submitted_at":"2019-05-29T10:50:32Z","title":"A Study of BFLOAT16 for Deep Learning Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.12322","snapshot_observed_at":"2026-08-08T10:20:02.751774Z","title":"A study of BFLOAT16 for deep learning training,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.751774Z"},"links":{"cited_paper":"/paper/1905.12322","citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:3277afd51011a3e2cc0d87f766e22259ef72cb8f85070cf4f1fefcec50c56bec","observation_id":"933cbc24-0067-4915-9828-d982de5f4ef6","resolution":{"observed_at":"2026-08-08T10:20:02.751774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.043039Z","title":null,"venue":null,"work_id":"65330618-3c22-4ab0-ac46-08ea2c4536f0","year":2023},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.754450Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:f1457fc786d5be4e43cda6aa33736600b08a399daf0af7d3bac440ffed6c166b","observation_id":"43ef57a5-c4a9-4925-8a90-b4a201bfa18f","resolution":{"observed_at":"2026-08-08T10:20:05.046128Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.033817Z","title":"Interactive investigation of traffic congestion on fat-tree networks using TreeScope,","venue":null,"work_id":"b4b9fdcb-9bcf-43b6-b4f9-9e57b0aac175","year":2018},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.757875Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:d42065629ef8ccd82a8fc11f552f3e89f66940390e3ec15cbed0c18a1d819665","observation_id":"7920df23-0bb7-4aa8-a738-cf3dca58ebf1","resolution":{"observed_at":"2026-08-08T10:20:05.036954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.024631Z","title":"Quantifying I/O and communication traffic interference on dragonfly networks equipped with burst buffers,","venue":null,"work_id":"84b45857-ec48-4d06-83b2-832995d4a2cd","year":2017},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.761481Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:7ba4322e2fa3ef9a402823ef1f596c715b6d4292cbef8afdfe0ce7dc0e58d2ff","observation_id":"0f67b059-0295-489a-8c68-5dbbec1579ef","resolution":{"observed_at":"2026-08-08T10:20:05.028284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.015475Z","title":"Quantifying memorization across neural language models,","venue":null,"work_id":"7e1a155f-c42b-427c-91a1-c45575a6ae0a","year":2023},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.764626Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:6a6bd07def2a847ff7ad7c59543c7016126bd5e1c8d5ab64751c3f6c945178e0","observation_id":"26feff98-4dfa-4171-9546-48f55f5f623d","resolution":{"observed_at":"2026-08-08T10:20:05.018885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.005545Z","title":"The times sues openai and microsoft over ai use of copyrighted work,","venue":null,"work_id":"ea5a9905-f95c-488d-bd87-b120aa17e0b2","year":2023},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.768307Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:ed0225b494d4c5336d231a52c6e4bfc9f364cb443b5cf6ea6151c4c288108ba6","observation_id":"648bc8e9-bf90-4fe9-b9dd-27e200a2238b","resolution":{"observed_at":"2026-08-08T10:20:05.008971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:02.771544Z","title":"Extracting training data from large language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.771544Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:f0ca02c22494cdf14c556c469324d27f58df63f3b8eddf03056d043f2f5fe46b","observation_id":"9efce775-2041-4e4a-ab0f-cbf5d21b4bf6","resolution":{"observed_at":"2026-08-08T10:20:02.771544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:04.991140Z","title":"Pythia: A suite for analyzing large language models across training and scaling,","venue":null,"work_id":"0990e70e-6724-438d-8a9a-d9b54d26dcd2","year":2023},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.774029Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:280569579b01381000e620a4d14a79b1f8a3b4107849b025df4d93116e679f2b","observation_id":"9d69f755-c00b-4b91-97d0-6c7080ca91fa","resolution":{"observed_at":"2026-08-08T10:20:04.994313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:04.982607Z","title":"Tinyllama: An open-source small language model,","venue":null,"work_id":"d7a190a6-5f29-4892-acfa-6c9a1ce17ba7","year":2024},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.777191Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:7bb117b9b61cdc0c991b6cb07553fac7a3ae3a2a6897273f86f27af2f47494da","observation_id":"178cdb6d-caa0-4152-ae75-80a4004fa1dc","resolution":{"observed_at":"2026-08-08T10:20:04.985533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:04.973723Z","title":"The llama 3 herd of models,","venue":null,"work_id":"ec5d9011-4da5-4c4e-821d-2211015d187b","year":2024},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.780659Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:574057eb0c98ec08aa877ec867c25a11056b74aac062339f92bec944d74b20ca","observation_id":"df901eb7-3427-494b-baae-7e033835fb2a","resolution":{"observed_at":"2026-08-08T10:20:04.976637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10209","last_updated":"2024-11-02T23:19:18Z","snapshot_observed_at":"2026-08-05T02:50:00.813169Z","submitted_at":"2024-06-14T17:44:22Z","title":"Be like a Goldfish, Don't Memorize! Mitigating Memorization in Generative LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10209","snapshot_observed_at":"2026-08-08T10:20:02.783216Z","title":"Be like a goldfish, don’t memorize! mitigating memorization in generative llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.783216Z"},"links":{"cited_paper":"/paper/2406.10209","citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:d95cfb5997f9ad97021f17ae01f565386c62a687ce346e2c740d7a3f7518770e","observation_id":"2145c077-2e84-45e2-9e97-4ed4002bfff4","resolution":{"observed_at":"2026-08-08T10:20:02.783216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T10:14:10.256368Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":5,"verified_fuzzy":33},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2502.08145."}