{"as_of":"2026-08-22T20:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:566b613f0cd2b0eba3196da40e8b7dfc463c33fdd0028e74532958fec55aff15","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T14:53:28.952395Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.13277/citation-record","integrity":"/paper/2608.13277/integrity","json":"/paper/2608.13277/citation-record.json","paper":"/paper/2608.13277"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:53:28.565114Z","title":"Scaling Learning Algorithms Towards","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13277","last_updated":"2026-08-13T14:13:46Z","snapshot_observed_at":"2026-08-18T09:20:16.562366Z","submitted_at":"2026-08-13T14:13:46Z","title":"Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-14T14:53:28.565114Z"},"links":{"citing_paper":"/paper/2608.13277"},"observation_digest":"sha256:ccf178e4c859687fd6cfa0e8fb52db723482261fda7a89e4f5514d3386445c4a","observation_id":"98109fd7-6f8b-40cb-b188-b0a7ed773738","resolution":{"observed_at":"2026-08-14T14:53:28.565114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:53:28.569461Z","title":"and Osindero, Simon and Teh, Yee Whye , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13277","last_updated":"2026-08-13T14:13:46Z","snapshot_observed_at":"2026-08-18T09:20:16.562366Z","submitted_at":"2026-08-13T14:13:46Z","title":"Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-14T14:53:28.569461Z"},"links":{"citing_paper":"/paper/2608.13277"},"observation_digest":"sha256:1ff82ac1c40c339c47b6a7a155bdd4599b4a14e399bed2cefc3f769dbbb85132","observation_id":"8dbfa3d5-3abe-47bc-91b7-33d60a19f9fc","resolution":{"observed_at":"2026-08-14T14:53:28.569461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:53:28.574174Z","title":"2016 , publisher=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.13277","last_updated":"2026-08-13T14:13:46Z","snapshot_observed_at":"2026-08-18T09:20:16.562366Z","submitted_at":"2026-08-13T14:13:46Z","title":"Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-14T14:53:28.574174Z"},"links":{"citing_paper":"/paper/2608.13277"},"observation_digest":"sha256:76f005ab75658d55f0d32bfacda4f50c8826a4041378437c8af9f584e5e69122","observation_id":"d9809a49-a920-4f2d-aaf9-b2d1ace22bea","resolution":{"observed_at":"2026-08-14T14:53:28.574174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-14T14:53:28.578151Z","title":"Brown and Benjamin Chess and Rewon Child and Scott Gray and Alec Radford and Jeffrey Wu and Dario Amodei , title =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.13277","last_updated":"2026-08-13T14:13:46Z","snapshot_observed_at":"2026-08-18T09:20:16.562366Z","submitted_at":"2026-08-13T14:13:46Z","title":"Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-14T14:53:28.578151Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2608.13277"},"observation_digest":"sha256:1d40cd5942406f602c99afbefd95af66884a865754912657e28f769a73e075bb","observation_id":"f4b26545-0aba-4d8e-b207-040213d58538","resolution":{"observed_at":"2026-08-14T14:53:28.578151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:53:28.607908Z","title":"2022 , eprint=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.13277","last_updated":"2026-08-13T14:13:46Z","snapshot_observed_at":"2026-08-18T09:20:16.562366Z","submitted_at":"2026-08-13T14:13:46Z","title":"Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-14T14:53:28.607908Z"},"links":{"citing_paper":"/paper/2608.13277"},"observation_digest":"sha256:9e392dddd901391cef3bef4687d0fb54b98c1bbae3879fc3ca48d504386f6508","observation_id":"60d5944c-e46d-4c57-8a01-fa4b810cc6d7","resolution":{"observed_at":"2026-08-14T14:53:28.607908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:53:29.547745Z","title":"2025 , eprint=","venue":null,"work_id":"64c4a27a-430b-48ec-9bc9-f0621a36c155","year":2025},"citing_paper":{"arxiv_id":"2608.13277","last_updated":"2026-08-13T14:13:46Z","snapshot_observed_at":"2026-08-18T09:20:16.562366Z","submitted_at":"2026-08-13T14:13:46Z","title":"Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-14T14:53:28.634888Z"},"links":{"citing_paper":"/paper/2608.13277"},"observation_digest":"sha256:05a1d2414108f852fe469452d775c18f3e68985fc97e4fd0a3b6cee8e3ec5d93","observation_id":"57dd31bf-f372-40a8-aa36-7e8140d730d5","resolution":{"observed_at":"2026-08-14T14:53:29.551475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:53:28.711059Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.13277","last_updated":"2026-08-13T14:13:46Z","snapshot_observed_at":"2026-08-18T09:20:16.562366Z","submitted_at":"2026-08-13T14:13:46Z","title":"Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-14T14:53:28.711059Z"},"links":{"citing_paper":"/paper/2608.13277"},"observation_digest":"sha256:ef3b44ad6b146d5e781eed4c74343e24e51ffe78e4429694346c162b19c6bfd3","observation_id":"ea31c015-7823-468e-b558-74bde54c95c2","resolution":{"observed_at":"2026-08-14T14:53:28.711059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:53:28.752336Z","title":"2020 , eprint=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.13277","last_updated":"2026-08-13T14:13:46Z","snapshot_observed_at":"2026-08-18T09:20:16.562366Z","submitted_at":"2026-08-13T14:13:46Z","title":"Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-14T14:53:28.752336Z"},"links":{"citing_paper":"/paper/2608.13277"},"observation_digest":"sha256:aa8e53cabc3811c097e57cce8c9450fa2cc11b8b6847381c6db3b2970c9a1dd9","observation_id":"4de13d72-2e35-43eb-a6c1-01df85b31d50","resolution":{"observed_at":"2026-08-14T14:53:28.752336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:53:28.755667Z","title":"2022 , editor =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.13277","last_updated":"2026-08-13T14:13:46Z","snapshot_observed_at":"2026-08-18T09:20:16.562366Z","submitted_at":"2026-08-13T14:13:46Z","title":"Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-14T14:53:28.755667Z"},"links":{"citing_paper":"/paper/2608.13277"},"observation_digest":"sha256:32d039d34844203c00beed0b87c092e0113ef9360bd3675c728689871ee249fe","observation_id":"bd4cc876-0765-4bbc-bf72-8170333a7469","resolution":{"observed_at":"2026-08-14T14:53:28.755667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:53:29.522828Z","title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) , month =","venue":null,"work_id":"f237610d-6727-42e6-8194-f1ac1b2ded9a","year":null},"citing_paper":{"arxiv_id":"2608.13277","last_updated":"2026-08-13T14:13:46Z","snapshot_observed_at":"2026-08-18T09:20:16.562366Z","submitted_at":"2026-08-13T14:13:46Z","title":"Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-14T14:53:28.759838Z"},"links":{"citing_paper":"/paper/2608.13277"},"observation_digest":"sha256:71f7af661bd1f99bd2cc20454b7950ebc75782e024bd49560c25abf2c6a1effb","observation_id":"1bb9491f-5c44-4b53-9652-71c82b67cdca","resolution":{"observed_at":"2026-08-14T14:53:29.526389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.12774","last_updated":"2019-04-29T15:32:14Z","snapshot_observed_at":"2026-08-19T14:59:37.132586Z","submitted_at":"2019-04-29T15:32:14Z","title":"Routing Networks and the Challenges of Modular and Compositional Computation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.12774","snapshot_observed_at":"2026-08-14T14:53:28.763874Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.13277","last_updated":"2026-08-13T14:13:46Z","snapshot_observed_at":"2026-08-18T09:20:16.562366Z","submitted_at":"2026-08-13T14:13:46Z","title":"Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-14T14:53:28.763874Z"},"links":{"cited_paper":"/paper/1904.12774","citing_paper":"/paper/2608.13277"},"observation_digest":"sha256:1d14798cee6baa86676ccf9e7f72fad42ad55f65be6f615ec2dd90ee27b95a95","observation_id":"9fcb1430-c893-4a7b-a565-e5e18a7b021a","resolution":{"observed_at":"2026-08-14T14:53:28.763874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:53:28.768724Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.13277","last_updated":"2026-08-13T14:13:46Z","snapshot_observed_at":"2026-08-18T09:20:16.562366Z","submitted_at":"2026-08-13T14:13:46Z","title":"Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-14T14:53:28.768724Z"},"links":{"citing_paper":"/paper/2608.13277"},"observation_digest":"sha256:7793b0e84de13d44faaa8d93f663b8d078a82ddb8953bd58bf8a80ccffd78753","observation_id":"c80b79f3-cb58-4040-8048-0be01b59df24","resolution":{"observed_at":"2026-08-14T14:53:28.768724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-14T14:53:28.772018Z","title":"2403.08295 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13277","last_updated":"2026-08-13T14:13:46Z","snapshot_observed_at":"2026-08-18T09:20:16.562366Z","submitted_at":"2026-08-13T14:13:46Z","title":"Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-14T14:53:28.772018Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2608.13277"},"observation_digest":"sha256:1910bc27052f07db1843494bdc3345ef13f8c5fee315d652c1d978cf7193afd3","observation_id":"8998f33e-0bee-4572-8c62-72568bff7f1d","resolution":{"observed_at":"2026-08-14T14:53:28.772018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:53:28.775615Z","title":"Distill , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13277","last_updated":"2026-08-13T14:13:46Z","snapshot_observed_at":"2026-08-18T09:20:16.562366Z","submitted_at":"2026-08-13T14:13:46Z","title":"Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-14T14:53:28.775615Z"},"links":{"citing_paper":"/paper/2608.13277"},"observation_digest":"sha256:c54341f2c62b13241d6f14a104b7234ade37c12790ef055cd6f737d3aa085865","observation_id":"3aef1a72-e43d-4464-9615-9cdf9654a132","resolution":{"observed_at":"2026-08-14T14:53:28.775615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:53:29.470530Z","title":"2025 , eprint=","venue":null,"work_id":"43fa01c6-6051-43c3-a089-24dc5f9e6591","year":2025},"citing_paper":{"arxiv_id":"2608.13277","last_updated":"2026-08-13T14:13:46Z","snapshot_observed_at":"2026-08-18T09:20:16.562366Z","submitted_at":"2026-08-13T14:13:46Z","title":"Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-14T14:53:28.778762Z"},"links":{"citing_paper":"/paper/2608.13277"},"observation_digest":"sha256:efd63eb9705d36a7bf0476772ca0eaebc2ae0e15b73987b0581cc0aa301a6842","observation_id":"0ad97f43-1212-435a-8428-8331de054987","resolution":{"observed_at":"2026-08-14T14:53:29.511405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:53:28.782353Z","title":"2022 , eprint=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.13277","last_updated":"2026-08-13T14:13:46Z","snapshot_observed_at":"2026-08-18T09:20:16.562366Z","submitted_at":"2026-08-13T14:13:46Z","title":"Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-14T14:53:28.782353Z"},"links":{"citing_paper":"/paper/2608.13277"},"observation_digest":"sha256:28d7acfdca8f22cad6540e588a73f60724e76730296bd0d3ddbd319f4f8c7683","observation_id":"95693b35-454c-4dd4-b555-fa24d7b8c296","resolution":{"observed_at":"2026-08-14T14:53:28.782353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:53:28.787436Z","title":"bert2 BERT : Towards Reusable Pretrained Language Models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.13277","last_updated":"2026-08-13T14:13:46Z","snapshot_observed_at":"2026-08-18T09:20:16.562366Z","submitted_at":"2026-08-13T14:13:46Z","title":"Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-14T14:53:28.787436Z"},"links":{"citing_paper":"/paper/2608.13277"},"observation_digest":"sha256:27aec673aaf8b03d7a1701607558f840f0966254b98c4350df1ffd44d9e25830","observation_id":"7ec37f5a-8f8a-4761-abd8-267d527b58ad","resolution":{"observed_at":"2026-08-14T14:53:28.787436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.07682","last_updated":"2021-06-14T18:05:10Z","snapshot_observed_at":"2026-08-16T18:17:13.448985Z","submitted_at":"2021-06-14T18:05:10Z","title":"Revisiting Model Stitching to Compare Neural Representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.07682","snapshot_observed_at":"2026-08-14T14:53:28.825001Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.13277","last_updated":"2026-08-13T14:13:46Z","snapshot_observed_at":"2026-08-18T09:20:16.562366Z","submitted_at":"2026-08-13T14:13:46Z","title":"Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-14T14:53:28.825001Z"},"links":{"cited_paper":"/paper/2106.07682","citing_paper":"/paper/2608.13277"},"observation_digest":"sha256:a656a05f9ae035f046641c9690e568bee23df0a623a3462ac76e490531afe281","observation_id":"911d241e-5440-49f3-adad-26074b55ca2a","resolution":{"observed_at":"2026-08-14T14:53:28.825001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:53:29.316058Z","title":"2023 , eprint=","venue":null,"work_id":"8c8d315f-3420-4961-956b-b7ca094e6af4","year":2023},"citing_paper":{"arxiv_id":"2608.13277","last_updated":"2026-08-13T14:13:46Z","snapshot_observed_at":"2026-08-18T09:20:16.562366Z","submitted_at":"2026-08-13T14:13:46Z","title":"Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-14T14:53:28.890106Z"},"links":{"citing_paper":"/paper/2608.13277"},"observation_digest":"sha256:69dc64795be47f3351267d8533c42c98d6e29c0699d0f11ed222ef48992c4243","observation_id":"8974cb8d-5f80-41bd-ac65-faedce62ac31","resolution":{"observed_at":"2026-08-14T14:53:29.380917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:53:29.257642Z","title":"Efficient Large-Scale Distributed Training of Conditional Maximum Entropy Models , url =","venue":null,"work_id":"6e4a4fae-a16a-4a78-8370-cc4b60c76165","year":null},"citing_paper":{"arxiv_id":"2608.13277","last_updated":"2026-08-13T14:13:46Z","snapshot_observed_at":"2026-08-18T09:20:16.562366Z","submitted_at":"2026-08-13T14:13:46Z","title":"Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-14T14:53:28.916907Z"},"links":{"citing_paper":"/paper/2608.13277"},"observation_digest":"sha256:86770b117b4b6b83217026457da742694fce03f9e0b677e22537a790b890d66b","observation_id":"6ffa92f1-a89e-4ef2-a459-d30c012bc284","resolution":{"observed_at":"2026-08-14T14:53:29.261207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-08-14T06:11:14.515796Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-14T14:53:28.919861Z","title":"Zhao and Kelvin Guu and Adams Wei Yu and Brian Lester and Nan Du and Andrew M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.13277","last_updated":"2026-08-13T14:13:46Z","snapshot_observed_at":"2026-08-18T09:20:16.562366Z","submitted_at":"2026-08-13T14:13:46Z","title":"Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-14T14:53:28.919861Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2608.13277"},"observation_digest":"sha256:a2537cb2b8d99072941a93243a1860d127b43bca86d49efa375dd38cd8d21fff","observation_id":"7b5f18d1-4900-4ca4-8629-ac78eac32f24","resolution":{"observed_at":"2026-08-14T14:53:28.919861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:53:28.923926Z","title":"2022 , eprint=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.13277","last_updated":"2026-08-13T14:13:46Z","snapshot_observed_at":"2026-08-18T09:20:16.562366Z","submitted_at":"2026-08-13T14:13:46Z","title":"Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-14T14:53:28.923926Z"},"links":{"citing_paper":"/paper/2608.13277"},"observation_digest":"sha256:04266cf0d16911ac4052c8288cf563bd96662b7791f2355e0bd224abed016d83","observation_id":"118a7fe0-25b7-4844-9d6f-4861088b1b81","resolution":{"observed_at":"2026-08-14T14:53:28.923926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:53:28.928129Z","title":"2022 , eprint=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.13277","last_updated":"2026-08-13T14:13:46Z","snapshot_observed_at":"2026-08-18T09:20:16.562366Z","submitted_at":"2026-08-13T14:13:46Z","title":"Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-14T14:53:28.928129Z"},"links":{"citing_paper":"/paper/2608.13277"},"observation_digest":"sha256:b7171983ba824ac612c70a1618f8f5f51c235c11386886ca4e3515b5f29dee4a","observation_id":"b0b9d635-7744-49ad-be65-ee5b67080821","resolution":{"observed_at":"2026-08-14T14:53:28.928129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:53:28.930690Z","title":"2022 , eprint=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.13277","last_updated":"2026-08-13T14:13:46Z","snapshot_observed_at":"2026-08-18T09:20:16.562366Z","submitted_at":"2026-08-13T14:13:46Z","title":"Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-14T14:53:28.930690Z"},"links":{"citing_paper":"/paper/2608.13277"},"observation_digest":"sha256:f2a930116d5cf14ff9d3679b7c9bac996d1a8f66f8b5e4e38da2f0aed2e0da0f","observation_id":"a2686474-1188-493b-95da-65c1bf6241a1","resolution":{"observed_at":"2026-08-14T14:53:28.930690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-14T14:53:28.934067Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.13277","last_updated":"2026-08-13T14:13:46Z","snapshot_observed_at":"2026-08-18T09:20:16.562366Z","submitted_at":"2026-08-13T14:13:46Z","title":"Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-14T14:53:28.934067Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2608.13277"},"observation_digest":"sha256:39b56818e73ee33d0dde878ce6052d1a82bd690589e4d058a79cf7b6c7150645","observation_id":"1a8ef394-e7e8-4f03-adaf-c0e050621e9d","resolution":{"observed_at":"2026-08-14T14:53:28.934067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:53:29.231117Z","title":"2026 , eprint=","venue":null,"work_id":"2607a3dc-7b6b-469c-b53e-18b4c9e11220","year":2026},"citing_paper":{"arxiv_id":"2608.13277","last_updated":"2026-08-13T14:13:46Z","snapshot_observed_at":"2026-08-18T09:20:16.562366Z","submitted_at":"2026-08-13T14:13:46Z","title":"Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-14T14:53:28.938634Z"},"links":{"citing_paper":"/paper/2608.13277"},"observation_digest":"sha256:c38e4a968803f2b162568eb12f920503b08adab24eaef0046c1473b33962efcd","observation_id":"1ae7bd33-5974-4081-a7a4-cb45b1d14471","resolution":{"observed_at":"2026-08-14T14:53:29.233856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:53:29.221590Z","title":"The Twelfth International Conference on Learning Representations , year =","venue":null,"work_id":"6b73b48b-d05e-4a90-bbee-c4f9aab2bff3","year":null},"citing_paper":{"arxiv_id":"2608.13277","last_updated":"2026-08-13T14:13:46Z","snapshot_observed_at":"2026-08-18T09:20:16.562366Z","submitted_at":"2026-08-13T14:13:46Z","title":"Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-14T14:53:28.942835Z"},"links":{"citing_paper":"/paper/2608.13277"},"observation_digest":"sha256:e33e3676da56ef27548f23f6bc77435b81b571178a24f0ad41941c78d6fcdf90","observation_id":"0ac3cd42-437f-4c24-a7e7-57e746b52d4b","resolution":{"observed_at":"2026-08-14T14:53:29.224560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:53:29.199691Z","title":"Stacking Your Transformers: A Closer Look at Model Growth for Efficient","venue":null,"work_id":"85e07d8f-7045-4487-a481-b579fa69b9a4","year":2024},"citing_paper":{"arxiv_id":"2608.13277","last_updated":"2026-08-13T14:13:46Z","snapshot_observed_at":"2026-08-18T09:20:16.562366Z","submitted_at":"2026-08-13T14:13:46Z","title":"Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-14T14:53:28.946202Z"},"links":{"citing_paper":"/paper/2608.13277"},"observation_digest":"sha256:44c395748116db6b9fd5060f82fe7ebedbbfb1aa13d034d6f431a4dc0393aad0","observation_id":"452539a7-ce9d-4dbc-b6df-63e6e4441c1e","resolution":{"observed_at":"2026-08-14T14:53:29.206022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:53:29.161144Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages =","venue":null,"work_id":"9a0cd663-4ffe-46f9-bb03-d3057bdebdce","year":2023},"citing_paper":{"arxiv_id":"2608.13277","last_updated":"2026-08-13T14:13:46Z","snapshot_observed_at":"2026-08-18T09:20:16.562366Z","submitted_at":"2026-08-13T14:13:46Z","title":"Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-14T14:53:28.949493Z"},"links":{"citing_paper":"/paper/2608.13277"},"observation_digest":"sha256:8d9f56a37aea408ee8d06aba06896535073f0ba6aa6817cda09ebdaa8eba2a17","observation_id":"af331a98-4586-494d-8ef1-4f6823dc5c4d","resolution":{"observed_at":"2026-08-14T14:53:29.190185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:53:29.028875Z","title":null,"venue":null,"work_id":"bb3faf15-7504-4c75-af6c-5a7d3e1384b6","year":2024},"citing_paper":{"arxiv_id":"2608.13277","last_updated":"2026-08-13T14:13:46Z","snapshot_observed_at":"2026-08-18T09:20:16.562366Z","submitted_at":"2026-08-13T14:13:46Z","title":"Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-14T14:53:28.952395Z"},"links":{"citing_paper":"/paper/2608.13277"},"observation_digest":"sha256:a1ed92570099348de14b88eb6d4ad6921b42989fb28a3eab0055450871ea3e61","observation_id":"f21f8c71-d134-4461-9602-267260c4bca0","resolution":{"observed_at":"2026-08-14T14:53:29.094967Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.13277","last_updated":"2026-08-13T14:13:46Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T09:20:16.562366Z","submitted_at":"2026-08-13T14:13:46Z","title":"Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2608.13277."}