{"as_of":"2026-07-26T14:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b1ef1fefb7df02ea2c71dc4c2ca881ca4e3ec4c3f606fa0c876686929d9707f0","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-07T11:25:24.079444Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-26T06:30:07.085553+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.26687/citation-record","integrity":"/paper/2604.26687/integrity","json":"/paper/2604.26687/citation-record.json","paper":"/paper/2604.26687"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.04805","last_updated":"2026-05-25T11:37:32Z","snapshot_observed_at":"2026-07-06T21:37:04.422359Z","submitted_at":"2025-06-05T09:31:41Z","title":"Adaptive Preconditioners Trigger Loss Spikes in Adam","version":2},"cited_work":{"arxiv_id":"2506.04805","doi":"10.48550/arxiv.2506.04805","metadata_source":"pith","pith_arxiv_id":"2506.04805","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Adaptive preconditioners trigger loss spikes in Adam","venue":"cs.LG","work_id":"db7678ee-f2b1-4958-8a1f-b1297a31e62c","year":2025},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"cited_paper":"/paper/2506.04805","citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:8941f7a981892b41445468c24acd9ccbddeb9d686a26c5f6baacafdc546966d4","observation_id":"ce38fdb5-67d6-490d-8838-a3eed637cf53","resolution":{"observed_at":"2026-05-26T03:04:02.571868Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"72711347-aa84-4f5d-829e-092f4c069d07","year":2017},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:42fd38afd364dac834e8f8422fd798b2cc3b774d956f0555075f123bcaee745e","observation_id":"b8151a1e-e8da-4712-a83f-24603cb0ab24","resolution":{"observed_at":"2026-05-27T07:08:46.193602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"22143a2b-bb7d-4160-89b8-5d46eca230de","year":2023},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:177d747476fdba08fcb24e2f35fbccfc97ac0c0cf27afa091e68668d13452b7e","observation_id":"96a41743-27f2-456d-8637-7534efa04ed1","resolution":{"observed_at":"2026-05-27T07:08:46.278555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.02029","last_updated":"2018-02-14T04:26:45Z","snapshot_observed_at":"2026-07-06T06:13:00.334649Z","submitted_at":"2017-12-06T04:19:14Z","title":"AdaBatch: Adaptive Batch Sizes for Training Deep Neural Networks","version":2},"cited_work":{"arxiv_id":"1712.02029","doi":"10.48550/arxiv.1712.02029","metadata_source":"pith","pith_arxiv_id":"1712.02029","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AdaBatch: Adaptive Batch Sizes for Training Deep Neural Networks","venue":"cs.LG","work_id":"78d3fee1-96a3-403f-a044-66214795b9f9","year":2017},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"cited_paper":"/paper/1712.02029","citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:bc80e68a7c1cb2a8a9384c630ff9bc2e049ffcef11e263799448e7c4c4535aba","observation_id":"fcbb17d8-1fb8-4e8c-831b-20bd2358824f","resolution":{"observed_at":"2026-05-09T03:55:07.651495Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.52202/079017-4485","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hé- naff","venue":null,"work_id":"8916cc98-310b-487c-ad2f-b178d9077221","year":2024},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:4c9f8dd61deca7fb19d136bfe5c7c90aa651959acab2847d38f339c5f539e6ca","observation_id":"2f7f0642-a84e-49c0-b1ee-5ecdee47d09a","resolution":{"observed_at":"2026-05-09T03:55:07.741005Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15389","last_updated":"2023-10-23T22:41:33Z","snapshot_observed_at":"2026-07-06T16:37:31.409792Z","submitted_at":"2023-10-23T22:41:33Z","title":"Irreducible Curriculum for Language Model Pretraining","version":1},"cited_work":{"arxiv_id":"2310.15389","doi":"10.48550/arxiv.2310.15389","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.15389","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"arXiv preprint arXiv:2310.15389 , year=","venue":null,"work_id":"2a77801e-1ac4-493c-9645-6dfa5a70bfa5","year":2023},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"cited_paper":"/paper/2310.15389","citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:0715705710a21eba87f01a4c5656ec7a077a3f69494f39487f394907fedb5171","observation_id":"ad1c541a-78f1-4a4c-b527-f853e15e41a6","resolution":{"observed_at":"2026-05-09T03:55:07.703229Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05838","last_updated":"2025-01-09T14:04:01Z","snapshot_observed_at":"2026-07-06T19:29:36.787126Z","submitted_at":"2024-10-08T09:06:34Z","title":"Time Transfer: On Optimal Learning Rate and Batch Size In The Infinite Data Limit","version":2},"cited_work":{"arxiv_id":"2410.05838","doi":"10.48550/arxiv.2410.05838","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05838","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"arXiv , author =:2410.05838 , file =","venue":null,"work_id":"96e098fa-834a-469b-84ef-6384644563c3","year":2024},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"cited_paper":"/paper/2410.05838","citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:5ebd7e3705880bb5a1a2d3d9c32044f8d2a14b078a2a99687b1f0aafa09e11d2","observation_id":"1aa72cfd-dbcf-4d09-a66e-2abe74b42c54","resolution":{"observed_at":"2026-05-09T03:55:07.782058Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3694715.3695964","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":null,"venue":null,"work_id":"e5b33999-5cdf-4036-ad67-e9a8765b957a","year":2024},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:cc25b4171ef859d3e20d4dec82aff65bcc9c058c38ab73e05b24e5bfe8ad5365","observation_id":"8231002a-53cf-4de0-9edc-2c0ccace7da9","resolution":{"observed_at":"2026-05-09T03:55:07.728713Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-07-06T05:46:07.424788Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":"1706.02677","doi":"10.48550/arxiv.1706.02677","metadata_source":"pith","pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","venue":"cs.CV","work_id":"f3dc32a4-cf81-467b-8ff4-3b2f21d3bf1f","year":2017},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:1b9c59eec20ea1502230003722cdfd93fb66c7c698ff2ccbf008a42a5c53b69c","observation_id":"62284fe0-7eee-49cb-b9ab-f074887264fd","resolution":{"observed_at":"2026-05-12T07:20:31.604247Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:09.485311+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:09.485311+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9c02f2f3-b912-41fa-b6ef-2039e4acadd6","year":2023},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:3d1457182fc2981245bdae0c766a6b631507c5164da92e5ec23e20bc17348d14","observation_id":"601ea0b9-43b9-46fd-a632-e1ee13d2f3b1","resolution":{"observed_at":"2026-05-27T07:08:46.204297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.52202/079017-2965","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f4ab8e2e-3562-4ace-9d65-fec49c6332e3","year":2024},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:8bb5d47bd2fef4184e5d85867586b9f774bc8655776c6a3b787354d145ec35f6","observation_id":"bd7a5c7e-6a6b-4398-874d-1a159a02bb94","resolution":{"observed_at":"2026-05-09T03:55:07.653949Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.841","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:43:07.039288Z","title":"OLM o: Accelerating the science of language models","venue":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","work_id":"2810cf0f-92b2-4eac-bf27-0fd54d24f591","year":2024},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:755edff7d0835de6e8c881f4ec3e958c788daf3ebc6af669312f8eb1a032b68d","observation_id":"9ed7c8cb-a4ad-42e2-b003-3e278f172253","resolution":{"observed_at":"2026-05-09T03:55:07.785088Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"64f7dcea-1502-4c4a-a11a-48ac16fa54e7","year":2019},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:a71831d22c5cb708316f254e073c5d41b3c7b53e69af906fe6fd2ec3d496c124","observation_id":"652722ba-7a5b-4793-bef1-fb2294cc0307","resolution":{"observed_at":"2026-05-27T07:08:46.246526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Johnson, Pulkit Agrawal, Haijie Gu, and Carlos Guestrin","venue":null,"work_id":"e2a8accd-d14e-4009-a3e6-e0bd386cac0c","year":2020},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:192d737636e3521053d211040fd82c82a9f9c5766b114d12650d2b557dbc77f6","observation_id":"094cb3e9-1cb1-4103-8d66-6e39a30a3ba5","resolution":{"observed_at":"2026-05-27T07:08:46.170634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.06201","doi":"10.48550/arxiv.2512.06201","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"K2-V2: A 360-open, reasoning-enhanced LLM","venue":null,"work_id":"c8a9349c-6402-49e7-a5e9-aa9ef8f89f3c","year":2025},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:97a5310851ede84eccab779b1b66c480d853149e03fd547914b9dd305cd7a29a","observation_id":"42311570-c6c6-4dcc-a2b7-f67cde179995","resolution":{"observed_at":"2026-05-09T03:55:07.818944Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:a05a80e6397436ece25f65451c0284e4b302055a37adffda7603f5cada68220f","observation_id":"ec1ff916-7ca9-4e3f-bdbe-59097e3f915c","resolution":{"observed_at":"2026-05-09T03:55:07.714200Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/tpds.2023.3247001","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T12:15:00.875560Z","title":null,"venue":null,"work_id":"68665ef7-edf2-4010-9f4d-5177e33d6c93","year":2023},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:dbbfd6d01c5f1377c056e2ae0d9b0679f78f1e7cbdeaff621eed3ed086ecbfcf","observation_id":"13b29926-4b86-4416-bb98-69a14df19eca","resolution":{"observed_at":"2026-05-09T03:55:07.752948Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11215","last_updated":"2024-05-28T05:40:38Z","snapshot_observed_at":"2026-07-06T17:31:33.340510Z","submitted_at":"2024-02-17T07:49:50Z","title":"AdAdaGrad: Adaptive Batch Size Schemes for Adaptive Gradient Methods","version":3},"cited_work":{"arxiv_id":"2402.11215","doi":"10.48550/arxiv.2402.11215","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11215","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":null,"venue":null,"work_id":"e4652852-3a93-4674-90b4-a03fa5ee1c04","year":2024},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"cited_paper":"/paper/2402.11215","citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:3c729db30a8e5a55a55d87144c18e506af41c59e2e671e64e5b8523faf5689f7","observation_id":"35e3f6af-612e-4efe-b773-e499fead9acf","resolution":{"observed_at":"2026-05-09T03:55:07.660974Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3581784.3607054","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":null,"venue":null,"work_id":"ed61d149-d1e2-4557-b60c-186f54f2baf2","year":2023},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:1b68d78455ec64538859443ae09bb1510f2915071a491ceb8bac1d705a186967","observation_id":"c22be6b6-4e45-4f36-9c61-8d76820745b9","resolution":{"observed_at":"2026-05-09T03:55:07.665859Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-12T02:49:49.827929+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T02:49:49.827929+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.52202/079017-4219","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"963a71e1-c52d-4348-a503-645011a04523","year":2024},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:f8d460a059eebd2069d1319cff20ea7faecc9c3ed0eff172faf6eee14b7204d0","observation_id":"dfbf74cd-450f-44aa-9d1c-8863fb2a7219","resolution":{"observed_at":"2026-05-09T03:55:07.787636Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"09e18593-91a6-4fa7-8d71-8ecca61a89f6","year":2025},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:43d3e82ca3deb5b1ae5f562366a0f13276bb4df4adf921d78a52bfffc0ee956b","observation_id":"adf083ba-5f0b-4fe5-9019-adedf364fa74","resolution":{"observed_at":"2026-05-27T07:08:46.173202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"33acdedd-fd04-4c19-8e69-731117e61c0a","year":2024},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:2b75130caae8e213e29e82478a13d5fc920ac67952da88a7b07dc5fac240bf6f","observation_id":"ee3c6446-778b-403b-aedb-a8e4b21c58c5","resolution":{"observed_at":"2026-05-27T07:08:46.179047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ecedda53-d3a4-4b96-be93-677f137ad541","year":2025},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:6e480b072c8d52447316a643bbfa5d1d2bba5c36f4796759fe57a7848b5fe138","observation_id":"8c54e1cb-da70-4bb7-b2d9-f6cc39af5844","resolution":{"observed_at":"2026-05-27T07:08:46.258468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2843cc3a-35c4-40bf-9a21-baccc4e053dd","year":2019},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:71a2b9b5e7eead99c07fe1e07d562e60d2e6abdde810b43f7ac9339e9ddc5437","observation_id":"448f98bd-ef6e-4c1b-a247-d0c76e71e8cb","resolution":{"observed_at":"2026-05-27T07:08:46.175937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hwang, Luca Soldaini, Akshita Bhagia, Jiacheng Liu, Dirk Groen- eveld, Oyvind Tafjord, Noah A","venue":null,"work_id":"b27878bd-1d9d-43a1-9f11-0c2be8696329","year":2025},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:33f08ba0df0d4157ae9376d7448a3643c3e350fb812484a7c8ac5a1310b9678f","observation_id":"4504aa58-5da4-4538-a447-c549edd90be4","resolution":{"observed_at":"2026-05-27T07:08:46.207787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a70a8dd7-c512-4580-9321-5d340ed66261","year":null},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:acf4e0441cfd5117dc3f0699fa44164539c987cd55738112253463923599f4f1","observation_id":"7c210070-74c6-43ce-b212-583b1a422cc5","resolution":{"observed_at":"2026-05-27T07:08:46.273102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"61bce4c3-b852-49d0-b9bc-00370407c8ec","year":2022},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:f08fd0b5782f0761686d15eb861b31054298e6fdd8c6bc35ed9ab53dcf5bb6ab","observation_id":"1898ec2f-7c16-4df7-bc05-7ab12df833ab","resolution":{"observed_at":"2026-05-27T07:08:46.261487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3d3bca00-a5eb-4377-a694-1f7478095cb7","year":null},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:c665df1c8519c0077669023fd296a0a70f35f99a84c95ac41a00ced42018a45b","observation_id":"f1a18a6e-f1ff-4991-9b06-7a01e79878fb","resolution":{"observed_at":"2026-05-27T07:08:46.264820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06162","last_updated":"2018-12-14T20:49:09Z","snapshot_observed_at":"2026-07-06T07:21:19.842962Z","submitted_at":"2018-12-14T20:49:09Z","title":"An Empirical Model of Large-Batch Training","version":1},"cited_work":{"arxiv_id":"1812.06162","doi":"10.48550/arxiv.1812.06162","metadata_source":"pith","pith_arxiv_id":"1812.06162","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"An Empirical Model of Large-Batch Training","venue":"cs.LG","work_id":"f3989b96-1ee9-403f-a0e2-0342ac16bcb7","year":2018},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"cited_paper":"/paper/1812.06162","citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:3ce082b8863742ea2e3a2453fe9b9795ccf5ebea3c872ddcb433d09f435d8a78","observation_id":"57059ce8-db1f-4aba-bfc9-a47f49585db8","resolution":{"observed_at":"2026-05-09T03:55:07.909709Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:37.038898Z","title":null,"venue":null,"work_id":"da946105-828d-40fc-81e5-1fe4a7d612b1","year":null},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:06666f52f452e084d7dc9c51a6740237a3ffa105c1496b506725a723d85ae38d","observation_id":"a353efde-e779-4263-b2e9-c4b061dbc102","resolution":{"observed_at":"2026-05-27T07:08:46.241037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In5th International Conference on Learning Representations, ICLR 2017, Toulon, France, April 24-26, 2017, Conference Track Proceedings","venue":null,"work_id":"d46e2d12-b300-4412-9a13-b209826e7c3e","year":2017},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:90f5943d60d585b6157eaef2bf00c79e10f367d6abd13dddac55595a44728734","observation_id":"38df66b6-61d8-430a-ab03-eded9d64606c","resolution":{"observed_at":"2026-05-27T07:08:46.249364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e23cd14d-4705-4e44-b36e-416d9e29537e","year":2025},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:863f5534361b444284a779ff2ccc276420e495c3b201ed0de7798663b0ca3e84","observation_id":"62d6381a-72c1-4f3c-a94a-1598383c7d95","resolution":{"observed_at":"2026-05-27T07:08:46.220323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"33a5c4cf-3940-42ac-9de5-838a1b50274f","year":2024},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:cea4a2b91f5d1e025f92b14d7483591a3ab44e19766b5a3f49caaf730ef3e4a4","observation_id":"a4247abb-69f1-4074-9ffc-7d73d9262932","resolution":{"observed_at":"2026-05-27T07:08:46.222981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.14778/3570690.3570697","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":null,"venue":null,"work_id":"0b33337a-989f-43fc-9f2b-57cb02dcf940","year":2022},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:378213c9eb1305cdb2c3ceaedac50afa382a59dcc3e10bc68c044923a30fcb52","observation_id":"88289efa-0657-4c64-b8ed-48a7b124cf08","resolution":{"observed_at":"2026-05-09T03:55:07.800411Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1301.33596","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:07:43.985209Z","title":"Devanur, Gregory R","venue":null,"work_id":"54677324-8b9b-46b3-98f8-4240293539de","year":2019},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:0c6a2809a880aad98483a4d0194f6fba7e68e08deff870b498674221afd21492","observation_id":"a462a08f-967b-46e3-b1b1-d877fb6e0a0e","resolution":{"observed_at":"2026-05-12T09:21:25.537054Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3458817.3476209","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Efficient large-scale language model training on gpu clusters using megatron-lm","venue":null,"work_id":"83348b97-fead-42d6-9b6c-276dad0b2de6","year":2021},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:0624cfadfaeae5361692bd29ccee14170ff2c154faa9009c536c8cec05214f63","observation_id":"4af3a16f-feb7-40fa-b6fe-0e1d708aec5e","resolution":{"observed_at":"2026-05-09T03:55:07.860344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-05-19T23:52:09.916547+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T23:52:09.916547+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1093/imanum/draf081","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ostroukhov, A","venue":null,"work_id":"a56dd408-61c5-44ce-a842-9f42a4af5ce6","year":2025},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:e9718d53c45825264fc8cdd74d4250c4db9114fc95de1bee4d868b65f436b4fe","observation_id":"2bff3644-c8c2-4bf1-92e8-4fe7facd7194","resolution":{"observed_at":"2026-05-09T03:55:07.827914Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"778a656d-5a0c-410e-8a3d-b141d7af6a71","year":2019},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:058a7f7b39cbbb0c573823409421c761361759f23f8f4ab00cb80be3d976d659","observation_id":"60f363e4-5414-4338-863d-ec9fdf5279c1","resolution":{"observed_at":"2026-05-27T07:08:46.217558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ganger, and Eric P","venue":null,"work_id":"e1d6b2a0-2d26-41d9-9d6b-d8c5a34eb468","year":2021},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:8f2b742c33adcbfa3bd0ec2aca4d8d725d5d7aa63135f3dae03d5002a1e3c0dd","observation_id":"0e494fdd-c1e0-47b3-ae00-043a44807060","resolution":{"observed_at":"2026-05-27T07:08:46.214569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a870fdfe-59c6-40ae-a204-f80c9f5f7f93","year":2021},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:a7c034e20a74d8f7bb2bd4108e34c7c9cf48549355eb787ee9fba5f5150731d8","observation_id":"e28580ac-427c-48d3-b5b1-36e5cb95f5dd","resolution":{"observed_at":"2026-05-27T07:08:46.232460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c37f110e-45e1-41c6-8071-46c0f650890b","year":null},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:7dc756b811f88bb64fd22429423c0e20a30737da925b54fa419df2478cf7b70b","observation_id":"9579db7f-2923-4297-9f68-ebb539621ac9","resolution":{"observed_at":"2026-05-27T07:08:46.211408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1405.2020","last_updated":"2014-05-08T17:04:15Z","snapshot_observed_at":"2026-07-06T03:43:11.009857Z","submitted_at":"2014-05-08T17:04:15Z","title":"Generalized Slow Roll for Tensors","version":1},"cited_work":{"arxiv_id":"1405.2020","doi":"10.1109/sc41405.2020","metadata_source":"pith","pith_arxiv_id":"1405.2020","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Generalized Slow Roll for Tensors","venue":"astro-ph.CO","work_id":"32348cef-09e4-43f2-b53c-d785fa1937a5","year":2014},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"cited_paper":"/paper/1405.2020","citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:e732a22407566d5f891002d2b40613f6170484bb44bb5def3f2f8f05884b6a0e","observation_id":"0658506d-9c48-4f4b-875c-4ac4f0b9d9ac","resolution":{"observed_at":"2026-05-09T03:55:07.806803Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:02.178338+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:02.178338+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:51:04.402593Z","title":null,"venue":null,"work_id":"6794fdf6-744c-40fd-936a-22951faf21b3","year":null},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:7a0a3fd7912606eac1bde09dba421df6b26a24d8e3e59f103d7d977be59500d6","observation_id":"4a6664c9-e81b-4e02-865b-7018e7cc4e46","resolution":{"observed_at":"2026-05-27T07:08:46.226485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"InKDD ’20: The 26th ACM SIGKDD Conference on Knowledge Discovery and Data Min- ing, Virtual Event, CA, USA, August 23-27, 2020, Rajesh Gupta, Yan Liu, Jiliang Tang, and B","venue":null,"work_id":"b69e4823-5ddb-4578-a3d0-36b80b36e93c","year":2020},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:4c0ae5a5a6dc659fe28ec9030f65b3bd41b1fa91fb8ba30f789f52d91ac65f96","observation_id":"a1bdddd4-090e-4948-868d-90fb5ab295ba","resolution":{"observed_at":"2026-05-09T03:55:07.812216Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3689031.3696071","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:15:00.872479Z","title":null,"venue":null,"work_id":"f83b095d-a7cf-4976-976d-bbe2cf47afe1","year":2025},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:5103cbca1026b339fadf7b83e2d956d4aadc8e12eea74a9f2940a0ae9aaf8d1e","observation_id":"efc689bb-b15e-4727-ab44-20a712fefcd6","resolution":{"observed_at":"2026-05-09T03:55:07.895409Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-07-10T16:37:23.051852Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:4c1126ba5fce237ea5640b09d2521ea19926d4f099bd7285c68f78f90b8ebe0a","observation_id":"97b7dfb7-82f8-4552-9540-c1bef589f5d5","resolution":{"observed_at":"2026-05-10T18:34:44.898910Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Smith, Pieter-Jan Kindermans, Chris Ying, and Quoc V","venue":null,"work_id":"10826940-d12f-4be1-be2d-2e80f834612d","year":null},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:d3438844878f6d7a5764acaafe6570f57fe15669b9e085668dccc761e525286b","observation_id":"3e648084-6253-435f-a355-63e530943292","resolution":{"observed_at":"2026-05-27T07:08:46.235470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In6th International Conference on Learning Representations, ICLR 2018, Van- couver, BC, Canada, April 30 - May 3, 2018, Conference Track Proceedings","venue":null,"work_id":"b5d00bca-c48c-4b59-9ed8-67bfaf9c4a09","year":2018},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:dc702246a17c767cc95417b02689f4c63bc39b822a5b3f552d65f9eeb90c1855","observation_id":"c7733b6a-8bcb-4450-8ec0-f7a95808bf52","resolution":{"observed_at":"2026-05-27T07:08:46.229753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3a11cdae-f254-489d-9d9a-097e4206fc26","year":2025},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:acf9490429207fecf18db94018713c13d2cbf49799a1b1ef00383dd3494b61c3","observation_id":"f89d5de7-e57f-40df-9c8d-865baaf4814a","resolution":{"observed_at":"2026-05-27T07:08:46.252282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:8c12b8f6dfbc8bbc682165ec6e9d4f55403cceaabf50937438dc119dee09c20c","observation_id":"e2d80675-c1b7-4bd2-978d-de83bf8685e1","resolution":{"observed_at":"2026-05-09T03:55:07.749487Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:32f6e2b2ef40096d4bbb15c475fbb246fa8ffe4bbc68cb20ecfd40aae8ce137b","observation_id":"6753e2cf-983b-46a7-b1e8-de90ce7ba1f5","resolution":{"observed_at":"2026-05-09T03:55:07.833943Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:a15b09b9b6c85b18b62c0672f324e99288a9ed4a403845a4e5edc9f09d6e176d","observation_id":"6526f3a3-3686-48fc-81c6-552acecd1825","resolution":{"observed_at":"2026-05-09T03:55:07.645264Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:ef16ee66124441789436923050cb7fa07ad110a4d50e02a18b5c5ed0fbd5179f","observation_id":"6bb2cda6-9ac3-4662-8c68-5c5959482551","resolution":{"observed_at":"2026-05-12T09:21:25.540607Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14987","last_updated":"2022-03-28T18:00:51Z","snapshot_observed_at":"2026-07-06T12:53:50.496350Z","submitted_at":"2022-03-28T18:00:51Z","title":"Multilingual Knowledge Graph Completion with Self-Supervised Adaptive Graph Alignment","version":1},"cited_work":{"arxiv_id":"2203.14987","doi":"10.48550/arxiv","metadata_source":"doi_reference","pith_arxiv_id":"2203.14987","snapshot_observed_at":"2026-07-09T21:46:34.506658Z","title":"Dickerson","venue":"cs.AI","work_id":"5c2060c6-427c-4321-be22-49ccae439d80","year":2025},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"cited_paper":"/paper/2203.14987","citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:59186e374b956475738c8d60a2d062ec44231fccb4236b748044129599049a39","observation_id":"f9f512a6-56a9-43b5-84b3-d0703a05d5a0","resolution":{"observed_at":"2026-05-09T03:55:07.697092Z","resolver_source":"doi","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0b0fc61b-3692-44e7-b0bc-5c84bff76da1","year":2022},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:da8f644a1f67657ffa7000434ed3bc17f15b4012e0e9502f406c6c700bc9e080","observation_id":"b6d9384a-fe9a-4a2f-96fc-3ae36ac4a281","resolution":{"observed_at":"2026-05-27T07:08:46.276074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d6863a3e-9ba5-49aa-993f-77dfafa8298f","year":2025},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:723d86b7ea8c5b7de5831c0828a2b011d1617e6477ca12e872b52d930f6c61ae","observation_id":"15484cfe-048c-4c9d-9cdd-bbb80a3e2661","resolution":{"observed_at":"2026-05-27T07:08:46.198936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c76f6b5b-7775-40a4-aa6f-1ff39be9932d","year":2018},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:3fa5f90e7824bd9bf7d64eb20055d45ba191755d72f3d5ebe0d05d75d1540e65","observation_id":"13b3fc24-bf70-402b-aaf6-91fd9aca806e","resolution":{"observed_at":"2026-05-27T07:08:46.196263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d8911f2c-922e-4bfa-b410-c3cf422b11b6","year":2020},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:c1678f9a6204b7fc883be1f5ac22b1b9555b34fae73f192ddc2b927b3c7c4aeb","observation_id":"74e294b7-1deb-44d3-bce2-d53319c5316b","resolution":{"observed_at":"2026-05-27T07:08:46.201466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Le, Tengyu Ma, and Adams Wei Yu","venue":null,"work_id":"ed84e75d-649d-4bce-afad-34f6fb43cd3c","year":2023},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:93c225d3fb10986d4c0a60bf5cfe0caffd68dda89de38a758808abfd2bd83230","observation_id":"4194a9f5-110f-4367-b78a-85e22cb590c8","resolution":{"observed_at":"2026-05-27T07:08:46.255331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04663","last_updated":"2021-12-23T21:29:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-05-10T20:54:58Z","title":"GSPMD: General and Scalable Parallelization for ML Computation Graphs","version":2},"cited_work":{"arxiv_id":"2105.04663","doi":"10.48550/arxiv.2105.04663","metadata_source":"pith","pith_arxiv_id":"2105.04663","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"GSPMD: General and Scalable Parallelization for ML Computation Graphs","venue":"cs.DC","work_id":"0ab74606-fb17-4ead-898b-8086ae8cb3af","year":2021},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"cited_paper":"/paper/2105.04663","citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:3c2770a7fb86acdb7eef32553b1bb3dc9ba7236a6534e0409bc8c8abb52df3d0","observation_id":"70e483b8-ae0c-4069-8124-f3b5418d3260","resolution":{"observed_at":"2026-05-18T12:36:36.562059Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"08ee8b2a-5941-4b5e-9bd7-da3141ee6358","year":2025},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:3886da756b0c3734bef99ebd99771578d1345b7a2d8b740463ee565547d2d1b9","observation_id":"4649e375-7598-4900-a0fe-95109555b71b","resolution":{"observed_at":"2026-05-27T07:08:46.190890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:09ef2c16afd806daed0bdbbb779af2510eb957f6ca6b4ef079f69453bb29b885","observation_id":"96145f5e-085a-467c-9748-aaffa710ea47","resolution":{"observed_at":"2026-05-10T20:53:19.162556Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9ef57382-9534-4c10-a208-088debaacc5f","year":2025},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:ecae038ae811616e0fa5e97ea9667f3764afd33405b875421c01a34a04471b53","observation_id":"e2c47dff-c6eb-4775-99d5-821c32b01db5","resolution":{"observed_at":"2026-05-27T07:08:46.243780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xing, Joseph E","venue":null,"work_id":"baed3f9e-d195-41f8-8619-65d72d3e025e","year":2022},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:90c22f02b340a9d565b689a91191a2506287613e4b7caa07676ba127d2d6763d","observation_id":"fcc0b277-6dc4-4f22-9536-8ea38b11997a","resolution":{"observed_at":"2026-05-27T07:08:46.267897Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2c1278c4-66bc-4a8a-80f2-25a4753faf2e","year":null},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:491de41135bf07392a523d27b3eb8169b39085b36f7473353a0aca6bc5a359fa","observation_id":"78c1d1ae-2c4d-45ad-bf0c-a3210fa3b712","resolution":{"observed_at":"2026-05-27T07:08:46.270669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"52b7c6ce-950c-4bef-8761-7805f349fecf","year":null},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:9fc2c6e9fef9f1e991dcf33da4fb5baa671f30da417341886620d47fa70a66e9","observation_id":"86d65717-f9e5-422b-b5f8-c6c962e63744","resolution":{"observed_at":"2026-05-27T07:08:46.187749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fe59d556-a271-4270-8043-41e5f0defcdc","year":null},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:70e4d36aadffc03ada2f0ee65f7b768fcbb5725ed33bdf554985ec2e4e8bcd51","observation_id":"0a6ce1e6-3564-4032-8c83-afda1d06ee0c","resolution":{"observed_at":"2026-05-27T07:08:46.182078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"46b0af95-a8a0-4c09-88fb-afd5e9f1c5b2","year":null},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:9a24f389b204e5f9841fc042439217d25ecf4aa21dcba13ef07968aea0637d5e","observation_id":"6d90268e-13e9-469c-adbf-b1e422569307","resolution":{"observed_at":"2026-05-27T07:08:46.184935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"020a9d63-227d-4f86-8f46-f11640841e74","year":null},"citing_paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-07T11:25:24.079444Z"},"links":{"citing_paper":"/paper/2604.26687"},"observation_digest":"sha256:63f46eb1bc51c8c1f756cb1c86d718044c4a44b396a1d77301a85ad043282316","observation_id":"1a2cccab-2ebe-412e-882a-4da2052ee7b6","resolution":{"observed_at":"2026-05-27T07:08:46.238088Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.26687","last_updated":"2026-04-29T13:52:38Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T13:52:38Z","title":"COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":3,"metadata_mismatch":10,"parse_uncertain":0,"unresolved":0,"verified_exact":20,"verified_fuzzy":36},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"thesis":"As of 26 July 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2604.26687."}