{"as_of":"2026-08-07T09:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5ec7207f3e0a5f12758da0253d4c72ae329e7a99ed018906c773ea34a9e87b26","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T02:30:31.465967Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.27731/citation-record","integrity":"/paper/2607.27731/integrity","json":"/paper/2607.27731/citation-record.json","paper":"/paper/2607.27731"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.277932Z","title":"Scaling laws for neural language models , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.277932Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:e3e492985114cde34f2ca36e615c50926f69e73ca3beb27434b2c1f150f10593","observation_id":"a4f09abd-868d-49c5-b591-d1476a528b42","resolution":{"observed_at":"2026-08-01T02:30:31.277932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.285046Z","title":"Training compute-optimal large language models , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.285046Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:9f0070fc66daeb8aeee46db8c0165a0bd3c7048dbce2bbd5c25cf45dd2a7c263","observation_id":"1557667a-c0d7-454d-9969-b215cfe19d9e","resolution":{"observed_at":"2026-08-01T02:30:31.285046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.289890Z","title":"Tensor Programs V: Tuning large neural networks via zero-shot hyperparameter transfer , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.289890Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:e8e8b37c61b98cdc752a4d0b67a8e77bdb185623e053d0e327e05698cae98d8a","observation_id":"16ad93d4-4ceb-48e0-8db6-1481f09af103","resolution":{"observed_at":"2026-08-01T02:30:31.289890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.294698Z","title":"Predictable Scale: Part I--Optimal Hyperparameter Scaling Law in Large Language Model Pretraining , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.294698Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:cbd4486721dd24c3b3cb2b7fbf28dc8b4c233cb51d049b49616d33c439e2e265","observation_id":"7f78136f-96a6-4165-b9d5-902085a387f3","resolution":{"observed_at":"2026-08-01T02:30:31.294698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.299730Z","title":"Measuring the effects of data parallelism on neural network training , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.299730Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:8251000c89485e9819630a5c84931678c7d4aa959857cccb30218380162ab434","observation_id":"02711bcc-cc9a-4db2-848c-9876b7659430","resolution":{"observed_at":"2026-08-01T02:30:31.299730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-07-06T05:46:07.424788Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-08-01T02:30:31.304519Z","title":"arXiv preprint arXiv:1706.02677 , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.304519Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:e7b22f81cf7a61d02f147a5c49ac26da0e3471565dcfeaba8ed7fe9eb21c5143","observation_id":"0f978401-68b8-4dad-b4bb-e42deeae8ace","resolution":{"observed_at":"2026-08-01T02:30:31.304519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.310142Z","title":"ZeRO: memory optimizations toward training trillion parameter models , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.310142Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:a5ac74deb73ac0d3817a4bfdde15160f95b5084fb3af2ece47af3653f462c057","observation_id":"2ec2b4de-42b7-4e19-bb58-8908ac2c2090","resolution":{"observed_at":"2026-08-01T02:30:31.310142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.314546Z","title":"An empirical model of large-batch training , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.314546Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:439841760c7753262d7f7a477919207d3fe69226e82a2e68fca523834d02b2bb","observation_id":"e81279bd-aaf9-43f2-9d47-d4aa02df63f6","resolution":{"observed_at":"2026-08-01T02:30:31.314546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.319195Z","title":"On the computational inefficiency of large batch sizes for stochastic gradient descent , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.319195Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:ddfeb6ba18077ca3338e7e03babd6452637abda82c0e17a47716d7a48c9881da","observation_id":"ce7e8e4b-a476-4543-8f1d-6e025e534118","resolution":{"observed_at":"2026-08-01T02:30:31.319195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.323341Z","title":"On Large-Batch Training for Deep Learning: Generalization Gap and Sharp Minima , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.323341Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:ed258b1442a31691f04c5037410b797747253b5ccc3527b3fd3ebb1bf1d18960","observation_id":"bfd4e69b-1c49-4792-b303-ada9b31010ee","resolution":{"observed_at":"2026-08-01T02:30:31.323341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.327601Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.327601Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:bb69adf4e28872ebf0ce469b8e08a41a3ad0bb2fe7981b20b3d7a732272d8556","observation_id":"3b21ab53-952a-4089-88f6-a1cbf3d59dd8","resolution":{"observed_at":"2026-08-01T02:30:31.327601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.331876Z","title":"How Does Critical Batch Size Scale in Pre-training? , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.331876Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:7a58df415e28c9de3c89438fd97e7d254ab5de3f59c12d95079541bcd1e8b53e","observation_id":"28bf1628-29bd-44be-991a-293b06f740aa","resolution":{"observed_at":"2026-08-01T02:30:31.331876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.335748Z","title":"Power Lines: Scaling laws for weight decay and batch size in","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.335748Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:9fc38389e29fdc177658bfb1ae84fa5e41ca6aa2af9a29c24e07fccf207ba6f8","observation_id":"5027ad07-0b20-4b03-9850-98b41caee495","resolution":{"observed_at":"2026-08-01T02:30:31.335748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.340124Z","title":"Scaling Law for Language Models Training Considering Batch Size , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.340124Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:48b1773b7d4a472f8f88981d413952faebf195a3f908af1b341c5b2bf4a78d99","observation_id":"b459aa26-2cb8-405e-b3a6-ee677284489d","resolution":{"observed_at":"2026-08-01T02:30:31.340124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.344155Z","title":"Deepseek llm: Scaling open-source language models with longtermism , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.344155Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:551b0dba63c467f6f3d7d60c3018146efb5867eb589327d10d43ff3f456eb86a","observation_id":"c0bd5a46-c7a6-4767-aeed-c5e8fcebf2f9","resolution":{"observed_at":"2026-08-01T02:30:31.344155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.348545Z","title":"Advances in neural information processing systems , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.348545Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:4ab0469e28a068d27935139478f2894315cda7c5cb01ff33370945f68e7dd646","observation_id":"a5290cee-4251-4e1a-b6a0-c996454cd005","resolution":{"observed_at":"2026-08-01T02:30:31.348545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.352888Z","title":"Dahl and Justin Gilmer and Christopher J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.352888Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:a03c77c31bf5a0ce895a4eb5fd52684996ab2cf4447f509007f51b9a921e3f3d","observation_id":"03c341b4-3a1b-4d35-a50c-f5e7a8bbc436","resolution":{"observed_at":"2026-08-01T02:30:31.352888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.357072Z","title":"Optimal linear decay learning rate schedules and further refinements , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.357072Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:3f5144c8b75fb48764dfc631bce4aba020fac38db59b91135f432cc2aa3ed2f6","observation_id":"6e057ee9-cc2d-4ecb-8836-14f19ff387e4","resolution":{"observed_at":"2026-08-01T02:30:31.357072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.361698Z","title":"International Conference on Machine Learning , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.361698Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:c7566cfcb52363a9d033aedea597c99cb19255db4d495141510a8059eb97c202","observation_id":"27433306-36ab-42e8-971c-bc48da2de2ac","resolution":{"observed_at":"2026-08-01T02:30:31.361698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.365901Z","title":"Tensor programs VI: Feature learning in infinite depth neural networks , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.365901Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:743cda25a369280d1185933711ba4fb8f8d3eaa010dac085822fcaa2960d46af","observation_id":"919ecf2d-645d-47ec-82f7-5dd445e7e0c5","resolution":{"observed_at":"2026-08-01T02:30:31.365901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.369931Z","title":"Don't be lazy: CompleteP enables compute-efficient deep transformers , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.369931Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:e93fb4ef707c40000a9e5a30e3ec47987ace4107a97b6ad98cb96285c91580b4","observation_id":"97fcd261-93b6-48d0-a4db-35a55fc1ccb4","resolution":{"observed_at":"2026-08-01T02:30:31.369931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.374132Z","title":"Scaling optimal lr across token horizons , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.374132Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:a7edce9a2fca00c59f5757bcf47285f37bea4d56198d27c0b1bd0ca26328ee20","observation_id":"a8d021f4-1f17-4576-b734-ae540928446c","resolution":{"observed_at":"2026-08-01T02:30:31.374132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.378151Z","title":"Convex Dominance in Deep Learning I: A Scaling Law of Loss and Learning Rate , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.378151Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:d575211918c202de494660e11eca92fa4967551cf3bbeca1a49793077c72319b","observation_id":"dccb3f46-a57e-4db8-8f3d-2afd3e0399f8","resolution":{"observed_at":"2026-08-01T02:30:31.378151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.382595Z","title":"Smith and Pieter-Jan Kindermans and Quoc V","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.382595Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:e5d38e7e11eaabfdf112297eef5271407635dc649157f7cca39800353b00b373","observation_id":"82787b68-d1cb-48ef-9b4a-74333a08ad79","resolution":{"observed_at":"2026-08-01T02:30:31.382595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.387016Z","title":"Coupling Adaptive Batch Sizes with Learning Rates , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.387016Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:1a76e6483535036f38a2cfcb6fa06925cf3f6a7f2e3bb8e4addac28e155a8442","observation_id":"e03d0bed-efd4-4646-bc84-eba3f8953d77","resolution":{"observed_at":"2026-08-01T02:30:31.387016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.391396Z","title":"Kakade , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.391396Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:34cc094eb95581a812f5237622e711e7de7d9ef10cf38a93d76eb202123969ca","observation_id":"b81864e0-f5c8-4d73-b751-70207baf4b17","resolution":{"observed_at":"2026-08-01T02:30:31.391396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.395484Z","title":"Critical Batch Size Revisited: A Simple Empirical Approach to Large-Batch Language Model Training , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.395484Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:547b475d7c7da2be8f744a94da03dd37c49940669b61d776aa807c9ed35536d2","observation_id":"f379c436-59ef-445b-8c6f-8ee89872d911","resolution":{"observed_at":"2026-08-01T02:30:31.395484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.399906Z","title":"and Vinyals, Oriol and Sifre, Laurent , booktitle =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.399906Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:edcfe71009e366d08e0b53523bc38c38bfe19d8325fd374e7519304c4720f713","observation_id":"c3b2249f-6b64-421d-b6b8-a1f7e0065a54","resolution":{"observed_at":"2026-08-01T02:30:31.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.404691Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.404691Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:a86784f310017c7e3c5c8e8168e69d6c78361ccaab964d26725b2efac7737021","observation_id":"11fd10c9-c282-4a9e-a5b6-84f6012a6b8e","resolution":{"observed_at":"2026-08-01T02:30:31.404691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.408852Z","title":"Scaling with collapse: Efficient and predictable training of llm families , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.408852Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:329becf12c8c1000ddebd91b5686c105f0b50f8cb21dad1d5a8fc372d52bc406","observation_id":"63de42c8-2987-49f8-8205-ef87020ba880","resolution":{"observed_at":"2026-08-01T02:30:31.408852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.412876Z","title":"nanoVLM , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.412876Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:363c79b7bd12f14d33cef47c78d24a2aaaf57d138a55b3d9624cd4c8ed2331a7","observation_id":"4cba753f-caf8-49fd-8aca-30701a4a05e0","resolution":{"observed_at":"2026-08-01T02:30:31.412876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.417630Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.417630Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:2cfb1b08d0d20d63e09832e581b8339b15e4eff58cd460f44c3fad7a2392effc","observation_id":"008879d9-3e34-4a87-b98b-14a6f47d0244","resolution":{"observed_at":"2026-08-01T02:30:31.417630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.422525Z","title":"2025 , url =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.422525Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:31fee29a99170ad6de9a6ddf4f3e291a29fb6b19f3d1bb4af86b87ff4b1d7001","observation_id":"647133a0-2539-4824-8aab-f16f0200c89e","resolution":{"observed_at":"2026-08-01T02:30:31.422525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.426919Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.426919Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:6536a7f39b4cc7d3c9ac2d8448b0bfc3ce8f56436daed9fbfd39d14cd6a7d320","observation_id":"2ff67876-1356-4b1e-a8e3-b1542c12936b","resolution":{"observed_at":"2026-08-01T02:30:31.426919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.430968Z","title":"Towards understanding of orthogonalization in muon , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.430968Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:3b6524ba84cc423f76e9a604666898eba809e50fc669ddae96a943e5af5a1a07","observation_id":"77a42980-df60-446e-9c58-f639a021a1bf","resolution":{"observed_at":"2026-08-01T02:30:31.430968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.435239Z","title":"Decoupled Weight Decay Regularization , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.435239Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:d67dd485880d4eb15bc326d6edb5dfe31796f9b781c4e57836f7657e6f416434","observation_id":"2f7ed834-10ea-413e-8ba7-0019c8af64c2","resolution":{"observed_at":"2026-08-01T02:30:31.435239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.439309Z","title":"The llama 3 herd of models , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.439309Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:6c204e33f4e37f3b8ed2e2d574f78b35f51c44f7a183d35c111a1ee703142074","observation_id":"d8437813-bce1-4246-af17-4fc4f80d11de","resolution":{"observed_at":"2026-08-01T02:30:31.439309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.443635Z","title":"Qwen3 technical report , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.443635Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:1dd1942c306412a95ed0c6b8e42e8c5d7cf74b4862a516718d6df7de09a4ba57","observation_id":"f61c3ee8-e5f9-4139-a9dd-cefd0e4f1210","resolution":{"observed_at":"2026-08-01T02:30:31.443635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.447762Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.447762Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:99b08202ddf87fb92583536c191fa8824a5be90b875b23cc05dd597df84fe654","observation_id":"055257f7-ffc9-4e2f-a6bf-455e34d9fb58","resolution":{"observed_at":"2026-08-01T02:30:31.447762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.452166Z","title":"Using deepspeed and megatron to train megatron-turing nlg 530b, a large-scale generative language model , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.452166Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:724b49b40cf1405e2aa3d2804bc28cf03cd2f84b007221fd415251798e433145","observation_id":"164d32e6-a81d-4e9d-9519-6abda6db7236","resolution":{"observed_at":"2026-08-01T02:30:31.452166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.456536Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.456536Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:7ba20c2e986149d027ef8d269f1dbdb03bf628af4181811bb4fba6afc1e4c0bd","observation_id":"7140253e-12c9-435c-a601-0936fe04c85a","resolution":{"observed_at":"2026-08-01T02:30:31.456536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.461248Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.461248Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:166b309ec74395a46244b490213bded36708419303fd0f47a839c12b8ab74f70","observation_id":"8faf06b4-5eca-473a-abfe-225e839683f7","resolution":{"observed_at":"2026-08-01T02:30:31.461248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:30:31.465967Z","title":"2023 , url =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-01T02:30:31.465967Z"},"links":{"citing_paper":"/paper/2607.27731"},"observation_digest":"sha256:a975de95c75f936f38b29b4a74d7b462e3b1bd8bd4d68dc6ff61cc83548997b7","observation_id":"ed54db25-b527-4ec9-bb62-30f43f4c3322","resolution":{"observed_at":"2026-08-01T02:30:31.465967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.27731","last_updated":"2026-07-30T06:14:04Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T23:39:49.485704Z","submitted_at":"2026-07-30T06:14:04Z","title":"Towards joint scaling laws with optimal batch size schedules"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2607.27731."}