{"as_of":"2026-08-09T11:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:67b9b6bb3d7dd7fe385d67317367134ac5e1445519f61b6a8f4e14d70aaf0f60","coverage":[{"denominator":107,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T17:23:55.291013Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.04927/citation-record","integrity":"/paper/2608.04927/integrity","json":"/paper/2608.04927/citation-record.json","paper":"/paper/2608.04927"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:54.951480Z","title":"Neural Networks , volume=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:54.951480Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:2963823067cd7f4e6db0ec8c48baaa3150beef6044f5103cfd3efa61fc832048","observation_id":"e23d139f-1991-478d-b669-65b08eb3a25c","resolution":{"observed_at":"2026-08-08T17:23:54.951480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:54.957471Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence , volume=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:54.957471Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:3c97b6a77d9614fb18e283ab7240408c654b4686e9a51f87e78a37b0a53b9f71","observation_id":"7a282466-fb66-4004-b1e4-f155f8454736","resolution":{"observed_at":"2026-08-08T17:23:54.957471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:54.961685Z","title":"Proceedings of the 37th International Conference on Machine Learning , series=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:54.961685Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:dac8c74c3b3d309f40e8b4310507c4ce845000fb460cd679d654866a75073d90","observation_id":"6d1d07d9-1105-4b79-ad3a-65696087eac6","resolution":{"observed_at":"2026-08-08T17:23:54.961685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:54.965989Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:54.965989Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:43f236b10d9ca2afd81cfce6b0539f71d895dc6485a0cc68850e08ddd5d741b8","observation_id":"3fcc8628-8b6b-4a8c-a121-7c461c655c90","resolution":{"observed_at":"2026-08-08T17:23:54.965989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:54.970044Z","title":"Proceedings of the 39th International Conference on Machine Learning , series=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:54.970044Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:715c5f4bbcea35cfe256b6a78ac8e0b0cd53c4b32f7749b2809392dc853079f4","observation_id":"6125fc55-c75c-435d-a75a-cffe541fb413","resolution":{"observed_at":"2026-08-08T17:23:54.970044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:54.973946Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:54.973946Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:517e7f5820950f9c97baa6bcd8a1b46027a28293f08634ccc158f96567f443b2","observation_id":"50435ea4-65a9-41b5-a061-14af19d3ba2b","resolution":{"observed_at":"2026-08-08T17:23:54.973946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:54.978059Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:54.978059Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:1f56aebbba81c200322a2dd1c7751d8c4d0e8e302f1f66aaab4a9f6fa6963afb","observation_id":"82b4073b-100c-475f-8d38-686a70e53b46","resolution":{"observed_at":"2026-08-08T17:23:54.978059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:54.981486Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:54.981486Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:c98160a62b354930dc1bcb2e57e261ca7b71799970a109a320bd52fe4c96712f","observation_id":"71bc4d43-8295-4b69-818e-e173224bb37b","resolution":{"observed_at":"2026-08-08T17:23:54.981486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:54.984888Z","title":"IEEE Robotics and Automation Letters , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:54.984888Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:d003ffb3ed59f5701736c6c7e69b972fce6f2dd91d09dbf690e536db6a58260a","observation_id":"80d2337f-8934-4f0c-81c9-2f90be31c8b3","resolution":{"observed_at":"2026-08-08T17:23:54.984888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:54.988603Z","title":"2025 , publisher=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:54.988603Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:e604ac25ee470b1bfc4eb65a0c4ba72366b061619a4ad294a9f6bfc6656d8f40","observation_id":"e793334b-7eb1-4cb4-be75-763fa4db1626","resolution":{"observed_at":"2026-08-08T17:23:54.988603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:54.992100Z","title":"The Eleventh International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:54.992100Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:c439fb1e5fad505452e332042c8e6cfa03015e6a09778fc5497b9ab0e723b6bc","observation_id":"79410c6d-b280-4e80-b3c5-428bba7960af","resolution":{"observed_at":"2026-08-08T17:23:54.992100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:54.995740Z","title":"Proceedings of the 34th International Conference on Machine Learning , series=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:54.995740Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:f0a5c4a3047c36b2ec2aea0f88bb5b2b803fb5cc73832364d087e3c07b435401","observation_id":"778a81ab-3bf9-49b0-b3a8-df6fdc3026a0","resolution":{"observed_at":"2026-08-08T17:23:54.995740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:54.999264Z","title":"Proceedings of the 39th International Conference on Machine Learning , series=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:54.999264Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:151f64d20b38d450d6dece005d23353d8c860ad81c6225150b618d472f4d9404","observation_id":"4a65cce3-68b0-40eb-b4ef-ad8fd3237142","resolution":{"observed_at":"2026-08-08T17:23:54.999264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.002614Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.002614Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:f3d1f1976b19b67a381d5eca172dce7ae0779305c17d6b51a5149fc4037d9bc3","observation_id":"b33f205b-2587-45fe-b14f-f02654ca301d","resolution":{"observed_at":"2026-08-08T17:23:55.002614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.005983Z","title":"The Thirteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.005983Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:321563b75763cd0fbc5114d77d92b769e29c5aceaecb2bae172f4b01d655ffd9","observation_id":"cc1cdec2-fe01-464d-9920-b033d85110a2","resolution":{"observed_at":"2026-08-08T17:23:55.005983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.009041Z","title":"Constructive Approximation , volume=","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.009041Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:fb112847cc3f6bd15dcc42eb6ea71f2dd5f5cb69bffa6a69977f61ecf523ca6b","observation_id":"b4176eaf-f84f-407f-b9a4-9200126447ac","resolution":{"observed_at":"2026-08-08T17:23:55.009041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.011834Z","title":"Journal of Machine Learning Research , volume=","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.011834Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:ee5f16334f728337bff30583f030b1d397aa6b2e533c0350f12493a2ee20fa20","observation_id":"28723244-f315-412c-8e3d-d17372ff3acf","resolution":{"observed_at":"2026-08-08T17:23:55.011834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.015260Z","title":"Proceedings of the 22nd International Conference on Artificial Intelligence and Statistics , series=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.015260Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:3896be7923ec8c8ff2f45f03d0811dbe022ba9965dfaca2c0c1d6b4f90032c79","observation_id":"bf8d2157-ba62-4526-88fe-550b97a6beda","resolution":{"observed_at":"2026-08-08T17:23:55.015260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.018585Z","title":"Proceedings of the 33rd International Conference on Machine Learning , series=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.018585Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:98f8f24b0f146f2151bf7dc6d60e7caf38a7b2ac15d75be8ce83f73b9c8488f9","observation_id":"24150688-c0c6-4dda-a958-1f92ea3cc9d5","resolution":{"observed_at":"2026-08-08T17:23:55.018585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.021522Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.021522Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:05a87307109a376dc0a3acee5806f696c28454cc58b01e5ef1970f831d04c81e","observation_id":"8b943b9d-b7c7-4560-b07a-2f8dd14a64d3","resolution":{"observed_at":"2026-08-08T17:23:55.021522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.024692Z","title":"Proceedings of the 41st International Conference on Machine Learning , series=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.024692Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:4e474680256b2a98977e3e4dccea3ffe25e13f45a959787b472a172b636ee8da","observation_id":"1ae1ee5b-0bd6-4b00-b173-6f0f6f9196d5","resolution":{"observed_at":"2026-08-08T17:23:55.024692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.027910Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.027910Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:ced88a76f5c8a2747c87ab506210e5a2948ffd3d08dc429431784ecf7eed54bb","observation_id":"8cf76e94-e1cb-4a1e-bd21-856ad541e518","resolution":{"observed_at":"2026-08-08T17:23:55.027910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.030952Z","title":"Proceedings of the 2nd Conference on Lifelong Learning Agents , series=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.030952Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:2d60ab7e7133c7603a070c5983905f103831ae19bc6a093e629f1ccd83d2fa67","observation_id":"c11a9925-a61c-4d91-b5d6-575ac9889460","resolution":{"observed_at":"2026-08-08T17:23:55.030952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.033985Z","title":"Proceedings of the 42nd International Conference on Machine Learning , series=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.033985Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:c159726a53d09e4928d3d4e2bc032a7404db72940acbe7e2f043efebecba9e2e","observation_id":"8e5d90de-de4b-4aaf-9776-b05eea297ec4","resolution":{"observed_at":"2026-08-08T17:23:55.033985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.037524Z","title":"Proceedings of the 35th Conference on Learning Theory , series=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.037524Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:0f409f356a026160af5edc846b166cbd55bf62cc50c315931781e1cb101afdef","observation_id":"42fb60bd-eb1d-49df-88a4-e812f61aebba","resolution":{"observed_at":"2026-08-08T17:23:55.037524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.041086Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.041086Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:29ee48f507e77a7f28ff121d487dc74a7c7bab1fd63ec33b7576707f5a7e709f","observation_id":"0bfc006c-c88d-4bd6-b4d3-9d91718a74f4","resolution":{"observed_at":"2026-08-08T17:23:55.041086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.044205Z","title":"From Continual Learning to","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.044205Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:f44b6c8624072ec705bd68d0756119d92d8823150ead0ee36de809a89736845d","observation_id":"fcc5815e-fcb0-40bc-a5de-1d755b6e7484","resolution":{"observed_at":"2026-08-08T17:23:55.044205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.473365Z","title":"Journal of the Physical Society of Japan , volume=","venue":null,"work_id":"346e66b4-6565-4161-b897-ba5a714732ce","year":1950},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.047395Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:cfa0f4c1ba413f95b5bc7fa4ede867d0ecbd1bb3a2655f4b67fc96b4c614225b","observation_id":"ee320a5c-54d4-42a2-9011-38725bb6a8ce","resolution":{"observed_at":"2026-08-08T17:23:56.476394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.464925Z","title":null,"venue":null,"work_id":"0fabb2af-bfc1-4e3f-9063-2a0fe4f7f8fe","year":2008},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.050567Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:a0193ec90ffe4f3f39e3c4ba90e2dff04018e74e861e3a0c65fc8f6707fe9b91","observation_id":"c7381799-d744-44a3-b69a-239176c81b92","resolution":{"observed_at":"2026-08-08T17:23:56.467980Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.455311Z","title":"Communications in Mathematical Physics , volume=","venue":null,"work_id":"e5acd45c-e0d3-40ef-84f2-75d7b05d703b","year":2012},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.053770Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:9cb78ad720239ceaf4c4325b46adc45d2b1533a4d95227ab3c0a4352ae305984","observation_id":"d27339df-c071-47d2-b9ba-f1b2336d30cd","resolution":{"observed_at":"2026-08-08T17:23:56.458708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.446012Z","title":"Journal of Dynamics and Games , volume=","venue":null,"work_id":"dadcfccc-629f-4877-84c3-c534087ce8e5","year":2014},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.061270Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:bf902fa79ac0fca3bba3cd4afac5136c38a744b3522650ad1c6cdc31e0997253","observation_id":"c5b818af-c52f-40a9-9308-9a8e5ba2c282","resolution":{"observed_at":"2026-08-08T17:23:56.449281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.436208Z","title":"Proceedings of the 26th International Conference on Machine Learning , pages=","venue":null,"work_id":"880811af-1fe0-4805-98b6-433f95ece338","year":2009},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.064990Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:39c3e3db11c00e82355873458f9779403b74d0b49ce6e066071c9f43ed3dc45b","observation_id":"e0536149-9791-4654-909e-8c130c9f8f53","resolution":{"observed_at":"2026-08-08T17:23:56.440004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.426251Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"cfc7a5fc-423d-4907-93df-f3230f48985a","year":null},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.068951Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:6efd70066e8b106ae3308629679d556f34c9dbfbb71fbfd41fe1efefe418feb1","observation_id":"5e2c05b4-f0ce-4ee3-8c72-c5efb30900e5","resolution":{"observed_at":"2026-08-08T17:23:56.429766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.416049Z","title":"Proceedings of the 35th International Conference on Machine Learning , series=","venue":null,"work_id":"65021a2c-3803-4ecd-8bf8-a6a4e53feb1d","year":2018},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.072405Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:cffee064942707b5968e17d201ada27aa88009132ca6f4f64b5746f35eeb390b","observation_id":"a3d88299-68a2-4e5e-acba-c6d9040b0ebc","resolution":{"observed_at":"2026-08-08T17:23:56.419862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.405858Z","title":"Proceedings of the 36th International Conference on Machine Learning , series=","venue":null,"work_id":"fb150b34-184c-44fc-8038-a2f8faa1fef1","year":2019},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.075631Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:299e7e75646560d20cf2127a5eb8ce8e93db5cf8c6fa77301c54a1fc2af2d0b5","observation_id":"b48ecbe0-5187-4281-b5bf-d5962d64dfcf","resolution":{"observed_at":"2026-08-08T17:23:56.409412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.395747Z","title":"Proceedings of the 37th International Conference on Machine Learning , series=","venue":null,"work_id":"d8eb7d07-bc91-48c1-9dd4-1174ecf26fc3","year":2020},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.078849Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:842ca64f5976ae1fbeee9a785107c408f5373eb99804f54ca82a6555b3624890","observation_id":"0bce7133-5bdf-4270-a477-480d3037b8f5","resolution":{"observed_at":"2026-08-08T17:23:56.399323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.385213Z","title":"2021 , url=","venue":null,"work_id":"973e250c-f9a9-4b76-ac80-ece9d8a4cd2f","year":2021},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.081993Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:ea7708106e30f05d51db3929f64b64a594394a050096b75601048fb63732e6f3","observation_id":"abf703a8-30b2-4a38-8f41-ddbc38c79f19","resolution":{"observed_at":"2026-08-08T17:23:56.388724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.374263Z","title":"Proceedings of the 39th International Conference on Machine Learning , series=","venue":null,"work_id":"a4c1ecfb-6b60-46c3-be41-b3836a4453a6","year":2022},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.085529Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:485b1d1aae3dd2aa62786dab987eb8c90891b94046f94b59cf9ffc89a5669b5e","observation_id":"22ed719c-ec9a-482e-8698-58d4def3ff01","resolution":{"observed_at":"2026-08-08T17:23:56.378213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.363972Z","title":null,"venue":null,"work_id":"e06e4c74-c18e-47ca-beec-8c4d734affa0","year":null},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.088866Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:b58f35459393ea35e0e319fb8c804225b7dea3d5b841769659a4bbb5940cd646","observation_id":"4a862d50-9737-467d-b0a8-d46b6e8e50c6","resolution":{"observed_at":"2026-08-08T17:23:56.367407Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.353275Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"46ccb7ce-2a96-4cab-bd7a-de0f8e19570e","year":null},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.092702Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:e3942737e39bac9c2fd26467e60ef5e5dc0ed9a77da3e5cec70811fda3cd8968","observation_id":"12ba1344-cd11-4d56-bcb0-fa9718b68417","resolution":{"observed_at":"2026-08-08T17:23:56.357236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.343795Z","title":"Machine Learning , volume=","venue":null,"work_id":"d4b8ff09-833b-45ce-af9d-3ca270004aab","year":2010},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.096213Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:a3b1a56c5e0261e201f1bf58770c4fecca72904653811e94c8e0d36409858747","observation_id":"e077afb1-fcca-4305-b605-444d669c55c0","resolution":{"observed_at":"2026-08-08T17:23:56.346734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.099569Z","title":"Journal of Machine Learning Research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.099569Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:2d3dbcf97a1730da4edb74ea4a7ea2250b6090ba03a2bd62c5fb5d44c3862ad8","observation_id":"52125504-a4da-4673-a341-6e68c74ada28","resolution":{"observed_at":"2026-08-08T17:23:55.099569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.328602Z","title":"and Darrell, Trevor , booktitle=","venue":null,"work_id":"b0e91779-b4af-4fd4-bd5f-08b8ac0ab13f","year":2018},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.103037Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:22b3a55fcfb11ac989b0385d6697503b2d87fba9713926576042555a609e775b","observation_id":"579a2bfe-8a9b-4cb5-892d-b76d3bf39c1e","resolution":{"observed_at":"2026-08-08T17:23:56.331512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.319619Z","title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":"c82d42aa-f938-4903-bd3f-75561df0e385","year":null},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.106482Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:6debc5e9065e62730b218995be7eff761d81b7bf34f6a79a7f8eac56b83c182d","observation_id":"1697a3b2-e63e-4565-8b87-0c89df3b5285","resolution":{"observed_at":"2026-08-08T17:23:56.322673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.309954Z","title":"Proceedings of the National Academy of Sciences , volume=","venue":null,"work_id":"79b5ad05-a6b2-4f83-b6a8-7af95cbea5a3","year":2017},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.110104Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:c9c7c3ee7681c2bce0b1c1dfc32a88cdf305fbe380624a7c3b432d9dde73d8c1","observation_id":"7d3cb934-a885-410e-995c-dcdd03f2eb6c","resolution":{"observed_at":"2026-08-08T17:23:56.313575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.300337Z","title":"Proceedings of the 34th International Conference on Machine Learning , series=","venue":null,"work_id":"fb08bf0e-fc70-4b28-a25d-99036f870793","year":2017},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.113652Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:94ce827918ef8d63ead087e6958c60a38e042de897b8490939f8a65d4c84c56c","observation_id":"ec8791c9-b6df-4e94-a37d-107286cefb90","resolution":{"observed_at":"2026-08-08T17:23:56.303863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.116812Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.116812Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:ffaba694bf93af039ef1a4410149494ed69e0b2a14ba1f17fbfc15b35b47809b","observation_id":"dbf5d8cf-6174-4948-8eaa-3029c5e32ae8","resolution":{"observed_at":"2026-08-08T17:23:55.116812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.120123Z","title":"Efficient Lifelong Learning with","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.120123Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:fc50b7e4c67b9269a215c672c54331e119bd76fcac1a641b7c59a21e23eab1fd","observation_id":"f885f70f-dd49-4e99-b0ce-30488489f77e","resolution":{"observed_at":"2026-08-08T17:23:55.120123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.275441Z","title":"Proceedings of the 23rd International Conference on Artificial Intelligence and Statistics , series=","venue":null,"work_id":"94e3dd08-6d61-49f5-96c5-44f0a6dc578d","year":2020},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.123655Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:007466ac4d3b71e6052c80c61a2dcb06c03ca54f1c1e995c887638dc1446449e","observation_id":"0385501a-c298-4012-a4f4-a28d5958e14f","resolution":{"observed_at":"2026-08-08T17:23:56.279286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.264231Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"5fbb297a-1007-46b7-839b-81a52fddceef","year":null},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.127136Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:5449ed51fe1919c5ff0f8bb8777216738d1462de35383e1120d20b57264d3261","observation_id":"aceb1571-d2a2-4446-a9d3-ec04bb57153d","resolution":{"observed_at":"2026-08-08T17:23:56.268028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.252497Z","title":"Proceedings of the 25th International Conference on Artificial Intelligence and Statistics , series=","venue":null,"work_id":"8b57a584-84b4-4d7c-9311-a8c494f86f77","year":2022},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.130420Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:6c4fb8086e9d18d8eee0a1c45ebc48ce03517f519a966388e849f8af6979d8e0","observation_id":"1e56ca72-5632-47dd-a3c5-4f41127f93b4","resolution":{"observed_at":"2026-08-08T17:23:56.256433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.241732Z","title":"Nature Machine Intelligence , volume=","venue":null,"work_id":"338a6236-a45e-4f0c-9715-31f2518a4d56","year":2022},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.133891Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:41f4fe9a5466a00fca129df63666a562c886e762d8897c8e696f2a0875fb23ac","observation_id":"21bae2fe-2e8a-45f4-9c63-f696dd4eb6e2","resolution":{"observed_at":"2026-08-08T17:23:56.245235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.231609Z","title":"IEEE Transactions on Computational Imaging , volume=","venue":null,"work_id":"4188d9b4-3301-40dd-8af2-f0ecad336a9a","year":2017},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.137163Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:7e8cead1abc80d1b7eec1025a3f1f09afbc59666516d18ed7f284b5c0c4d34dc","observation_id":"dda83449-15c7-4440-b343-65eef2a4f8dc","resolution":{"observed_at":"2026-08-08T17:23:56.235261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.221177Z","title":"Advances in Neural Information Processing Systems Datasets and Benchmarks Track , year=","venue":null,"work_id":"8c1ea291-4fb5-44cc-8f48-5f8c16f51b7d","year":null},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.140355Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:44869101587be31800ce47b35fc78e36e53f0b038307bb811d7600041d34230d","observation_id":"ea11b1be-039e-4c82-ba3a-a108e88eb7e1","resolution":{"observed_at":"2026-08-08T17:23:56.225014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.210932Z","title":"Zico Kolter, and Ryan J","venue":null,"work_id":"22834480-4048-442b-824f-4aea6e8d78af","year":2019},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.143750Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:a33aaaf4669a5f49304fadb46e315efdf90f5b8d2a707bb71d605ba9dabe88a4","observation_id":"9713cd79-b8a4-4b70-a7d0-530f0c7f2efa","resolution":{"observed_at":"2026-08-08T17:23:56.214530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s00220-012-1504-1","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.384583Z","title":null,"venue":null,"work_id":"29ee3549-1a2d-4600-8921-30dac7c1d74d","year":2012},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.147041Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:5dfe0c1a543aa4661b2969ef62a490ebc5c28dda7782829a8c8652c053490c5c","observation_id":"d8e4909d-b907-4bf2-a8f4-866881226438","resolution":{"observed_at":"2026-08-08T17:23:55.389672Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.150234Z","title":"A theory of learning from different domains","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.150234Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:6f90c49a32a532034338659bfc8cca4e607a65ec01556a28deb6441fa7fbf29c","observation_id":"525b6b8a-5743-494d-8216-0e23aa91a675","resolution":{"observed_at":"2026-08-08T17:23:55.150234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.153061Z","title":"Curriculum learning","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.153061Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:afcc5c51a126ec445457feba8bdb3137237849a50c3c306f0aa87499c6c86634","observation_id":"bad29b34-21bf-45b2-866f-d0af9ecd2e5a","resolution":{"observed_at":"2026-08-08T17:23:55.153061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.200134Z","title":"Unifying importance based regularisation methods for continual learning","venue":null,"work_id":"a2fa6f41-98d6-45c4-9d9c-1c0eba3f6b42","year":2022},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.155697Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:f2c5a4ab87cfa5f277302bf796534f7939b803f38f2d911b83f5938589f82feb","observation_id":"667f9263-4f93-4677-bd48-e071811041de","resolution":{"observed_at":"2026-08-08T17:23:56.204195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.188668Z","title":"Efficient lifelong learning with A-GEM","venue":null,"work_id":"95626f44-6ea0-46f4-983a-135927ea0448","year":2019},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.158282Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:ddb7c1385ea94386c1c8222c925bbcf60c89ec194deaf6aac15daf3c46580c33","observation_id":"32af7795-7e32-44c2-bf63-6c51dddddf4d","resolution":{"observed_at":"2026-08-08T17:23:56.192599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.176617Z","title":"Gradual domain adaptation without indexed intermediate domains","venue":null,"work_id":"d6f25f48-3008-4672-9665-99456bdb81a5","year":2021},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.160809Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:f99f76ce2edb87b36c9c3c73103e281f58babd410d39b18f8018a264cf6476ff","observation_id":"ba1927b4-4334-4475-9e8d-e9b32a3d67d4","resolution":{"observed_at":"2026-08-08T17:23:56.180838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.163358Z","title":"A continual learning survey: Defying forgetting in classification tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.163358Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:49416b25bf9fe1e5c0aab54fcf329d769898f60fb0edbf090597d23729ad1357","observation_id":"9c8b1a8b-80bd-4395-88a3-5e0f785e7ee9","resolution":{"observed_at":"2026-08-08T17:23:55.163358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.164042Z","title":"Marsden, and Bin Yang","venue":null,"work_id":"df148744-5c4e-4547-9f3c-e6ea80f9de43","year":2023},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.165952Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:5fdbcbbd5959d26808f45e5459eec61e3fe83141b0f9df81a91b3e3458bc9ffe","observation_id":"3f2ca09f-6bde-4cda-ad4f-6d84f81fd830","resolution":{"observed_at":"2026-08-08T17:23:56.167856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.152987Z","title":"Dynamic update-to-data ratio: Minimizing world model overfitting","venue":null,"work_id":"06962905-2629-4da2-b425-4bfa1bfead70","year":2023},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.168575Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:22b63c78e80a596002ccd8c6dd6a08b6b4d5ea392374314e24d25a92c05cd9b1","observation_id":"19350aa3-5693-4370-83fe-412333536589","resolution":{"observed_at":"2026-08-08T17:23:56.156451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.141878Z","title":"Ward, Nathan Srebro, and Daniel Soudry","venue":null,"work_id":"9c6942b3-bfa9-4d79-b1e0-f404c0b2fa37","year":2022},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.171526Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:e525f86d3a687478938dfaa4ebfdb80dd346ccd00d1ba90fd5da0bcf7cfc3d1a","observation_id":"b737c49a-0958-4c88-9422-5a91fe48e588","resolution":{"observed_at":"2026-08-08T17:23:56.145832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.129815Z","title":"From continual learning to SGD and back: Better rates for continual linear models","venue":null,"work_id":"0ac2ef98-fdc8-45ce-853f-7bd0beef1f0a","year":2026},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.174951Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:377667a84fac0a8b17c499ced10306405cb9d4497e14cfe90b62608e34adb376","observation_id":"cf04c0e0-676f-4026-8cd9-695e5550a704","resolution":{"observed_at":"2026-08-08T17:23:56.133975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.118073Z","title":"Orthogonal gradient descent for continual learning","venue":null,"work_id":"fe84aca6-846c-4655-b7a9-7a25bfcb0f4c","year":2020},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.178276Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:b59c2a7e0432189195d4f833584727061917970268876a3d91cc6caee7d312c1","observation_id":"a0fd1e7a-1392-403b-9b9a-ff44a0e293ac","resolution":{"observed_at":"2026-08-08T17:23:56.122217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.181785Z","title":"Domain-adversarial training of neural networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.181785Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:e1c09c090f1d879e2bb14a55b2bcd0aa41001faf881527fc4aa5e9c4ccaade0f","observation_id":"81540749-9d34-45e6-944f-989b88512639","resolution":{"observed_at":"2026-08-08T17:23:55.181785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2017.26998","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.588694Z","title":"a henb \\","venue":null,"work_id":"1372103a-4180-4cfc-93ce-fe5876a5b9f2","year":2017},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.184959Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:f74dc9618fd424637c4b6eed933123d13950497c8ab1727a6d922ed0013e98a7","observation_id":"b5025385-0bae-4ef9-ac6c-69f0d699f458","resolution":{"observed_at":"2026-08-08T17:23:55.597503Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.097310Z","title":"The importance of being lazy: Scaling limits of continual learning","venue":null,"work_id":"33fac430-d06b-4fd1-83fb-dcf7e4d0a37a","year":2025},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.188394Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:b3ca9c304e8013aa38500ea786db3e5fcea525490f34dc91ad05a6c2c670ba70","observation_id":"3242efd6-3052-4981-8000-e54763bf9572","resolution":{"observed_at":"2026-08-08T17:23:56.102028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.085717Z","title":"Bellemare, Jacob Menick, R \\'e mi Munos, and Koray Kavukcuoglu","venue":null,"work_id":"14c71659-dee5-4861-ab87-830425b2e52c","year":2017},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.191925Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:a9bf38c097d582a1a0a6def5811ed2e0c7cac07e070bd28470f1d664070329f5","observation_id":"b9d84df5-0cf4-437c-9d25-2b2bbe59f688","resolution":{"observed_at":"2026-08-08T17:23:56.089738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.074054Z","title":"On the power of curriculum learning in training deep networks","venue":null,"work_id":"27d87186-0fcf-445f-ba3c-55acd533ff0c","year":2019},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.195309Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:428d2a84d30b173f3d1ef6103ee130b8fa1780f7a5f311e26270186db5f015c8","observation_id":"a13ea8ad-30f6-451e-86ed-880454ec70ca","resolution":{"observed_at":"2026-08-08T17:23:56.077937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.061905Z","title":"Train faster, generalize better: Stability of stochastic gradient descent","venue":null,"work_id":"077402c8-cc83-4b0b-be23-4ea74bd5ac29","year":2016},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.199394Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:ee57528689bf08999381b6be4085f129e79271214261c54a7580712cccd251c0","observation_id":"39c725d8-48fc-454a-9bc7-fd07d05d5fd2","resolution":{"observed_at":"2026-08-08T17:23:56.066390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.050174Z","title":"Efros, and Trevor Darrell","venue":null,"work_id":"565a2d2c-be76-4229-8228-e43073c6f90c","year":1989},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.202784Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:531c22f3f969beb3f939a2c38ba424ff88ce47ccc2aaba9eb6d4bcde03f000a7","observation_id":"ecfdf522-f9ea-4d47-b8f4-888b1ecfbe11","resolution":{"observed_at":"2026-08-08T17:23:56.054085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.038281Z","title":"Curriculum reinforcement learning using optimal transport via gradual domain adaptation","venue":null,"work_id":"7bc78a36-0590-41c9-836f-b8e0091a7886","year":2022},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.206339Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:6a53c9bc9563c528cedae07688f561c8674397f1fdd7803f98a4141df069eb81","observation_id":"07f56e1d-15a6-497f-a5b2-1541be0264f3","resolution":{"observed_at":"2026-08-08T17:23:56.042421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.209876Z","title":"On the adiabatic theorem of quantum mechanics","venue":null,"work_id":null,"year":1950},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.209876Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:0dfc82acfb349345fe3c4728989910d84a6a3ffd80c0b4081dc65d26cf277d22","observation_id":"f980245a-77d2-4992-bc01-25e7c75483d8","resolution":{"observed_at":"2026-08-08T17:23:55.209876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.213423Z","title":"Rusu, Kieran Milan, John Quan, Tiago Ramalho, Agnieszka Grabska-Barwinska, Demis Hassabis, Claudia Clopath, Dharshan Kumaran, and Raia Hadsell","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.213423Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:e10e840dbb7ea4a62f3a08f92c0d332bdca4298cb1fb7044e45d22968d341ced","observation_id":"915bb5f1-f909-4f5d-a57d-65d7d5e9dbb8","resolution":{"observed_at":"2026-08-08T17:23:55.213423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.025648Z","title":"Curriculum reinforcement learning via constrained optimal transport","venue":null,"work_id":"bc534008-791b-402e-bb9d-77ecff2d6171","year":2022},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.216889Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:28facdadc31d6a6497161a769412dd3fab1d79401adfd3c2a069355c7ac7e187","observation_id":"8efb8743-af9f-47cd-b4ae-70bd546a27aa","resolution":{"observed_at":"2026-08-08T17:23:56.029953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.013128Z","title":"Understanding self-training for gradual domain adaptation","venue":null,"work_id":"a7b814e3-94b1-4841-a741-d3328eb9c99c","year":2020},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.220564Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:ad9363252d3fb54e9dc7717f616826e67428e67d14ee5c11b769ca26c3e453ec","observation_id":"fa6f26bf-c0aa-4ae0-b206-1b5a1c646498","resolution":{"observed_at":"2026-08-08T17:23:56.017534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:56.000793Z","title":"Pawan Kumar, Benjamin Packer, and Daphne Koller","venue":null,"work_id":"704b6243-b2ff-4950-abcd-49d84495e45b","year":2010},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.224025Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:ac6545f5472e9964933500e0fd8f2f662871b936797647997ba8f061f2db5553","observation_id":"4fd5523c-07d7-4eaf-a037-4108aad70d6a","resolution":{"observed_at":"2026-08-08T17:23:56.004767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.988203Z","title":"Challenging common assumptions about catastrophic forgetting and knowledge accumulation","venue":null,"work_id":"b6a298b4-413f-4dae-a685-de2f94af98e1","year":2023},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.227650Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:a180da9316e3c9dc8bb6bf54f72c8651c3bf3c6bbdeaaf87d05c0d983bc758b3","observation_id":"e768f1fe-6e5c-40ed-858a-d3baeb0be961","resolution":{"observed_at":"2026-08-08T17:23:55.992349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"hash/5712575","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.506727Z","title":"Optimal rates in continual linear regression via increasing regularization","venue":null,"work_id":"9e19bf95-589f-48fb-9254-1379ed4f4510","year":2025},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.231073Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:abb3122b53ef45946d2c08a69ddeee4ae5e55988645f4d505cbe38d4bcbc71dd","observation_id":"17326707-639d-4958-899a-6990a7e19c3d","resolution":{"observed_at":"2026-08-08T17:23:55.512645Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.975798Z","title":"Gradient episodic memory for continual learning","venue":null,"work_id":"7b3cc202-c679-4cb1-9eb8-82c9cd67b8cc","year":2017},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.234563Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:fb2501a887294bfd24e1c53effe7fcd87f989ab8df1d44f0d803d510e455d47f","observation_id":"bc245f15-1dea-4e33-9dc2-d726e8e996c3","resolution":{"observed_at":"2026-08-08T17:23:55.979861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.964728Z","title":"Understanding the role of training regimes in continual learning","venue":null,"work_id":"48941c25-b4f4-4d54-be03-bdb3efb39178","year":2020},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.237802Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:a5ffbb2d31fa8e71f55a75f063afb573e3d6842a197f75a973ba4010a6947311","observation_id":"5758210b-7cf1-4e05-b5bf-1a0d2f393328","resolution":{"observed_at":"2026-08-08T17:23:55.968182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.953917Z","title":"Optimal protocols for continual learning via statistical physics and control theory","venue":null,"work_id":"b85ecc8c-d4c1-4c8d-9967-1a09d129a480","year":2025},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.241255Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:bd6c0adab3e973372243d63bc959276615789360320f26dea8b706731d894c15","observation_id":"d56dc019-7e13-4916-a1b9-0fc5d2e6b9de","resolution":{"observed_at":"2026-08-08T17:23:55.957586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.942983Z","title":"Efficient test-time model adaptation without forgetting","venue":null,"work_id":"15d0b453-de52-4d15-98ea-7f4acc9aaa1a","year":2022},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.244578Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:1f993d85e1a072260145067d81ce4a838699626fbbaa24837a068f01caff7685","observation_id":"4c125bbc-2d11-4560-9ae1-8d9735659eec","resolution":{"observed_at":"2026-08-08T17:23:55.946293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.931798Z","title":"Towards stable test-time adaptation in dynamic wild world","venue":null,"work_id":"af0d153a-d55e-4dea-b52e-897166b2cb13","year":2023},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.247976Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:e51b18f7830233e77e0f36b830eb3c138bc2fab9d786dae45d4270032285d1cb","observation_id":"9024b7fd-7cfb-4e77-bffb-8f0dee92606a","resolution":{"observed_at":"2026-08-08T17:23:55.935798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.251415Z","title":"Parisi, Ronald Kemker, Jose L","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.251415Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:f0bc00a35ae8faaf39ab00ff6f748e4fdae804a75d62433e66e1a625c69522a1","observation_id":"caa34e78-1ca6-4068-9c94-08a7db404630","resolution":{"observed_at":"2026-08-08T17:23:55.251415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.919291Z","title":"Wainwright, and Bin Yu","venue":null,"work_id":"0c6939d3-5703-483c-bcc5-c791261f704c","year":2014},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.255359Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:2e0888ac5982f7bba1bfcd69f5efb34718bb0c88edca07546ea61d0865930390","observation_id":"b67db30f-b1f7-4a22-aeaf-11f79d86a641","resolution":{"observed_at":"2026-08-08T17:23:55.923543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.907515Z","title":"Online structured laplace approximations for overcoming catastrophic forgetting","venue":null,"work_id":"3e018972-743c-458b-aa97-30e5a6ea64a2","year":2018},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.258513Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:509b4cce87f8c2aae76355671bf26d2ac13371cde5311bd944a84dbc2e1981af","observation_id":"faae7793-d04e-4acb-80ce-fd7d74b5252b","resolution":{"observed_at":"2026-08-08T17:23:55.911521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.895844Z","title":"Maximum classifier discrepancy for unsupervised domain adaptation","venue":null,"work_id":"d0061de6-f913-42ad-be12-e111ec9ee1ba","year":2018},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.261834Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:1659420869b6b93b700e9234d7646261bf7dd2df7d623da91eb1c8da24dca904","observation_id":"3308c1a8-2a0b-4782-8e7b-a878b8be4ffe","resolution":{"observed_at":"2026-08-08T17:23:55.899814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08356","last_updated":"2023-04-15T04:03:04Z","snapshot_observed_at":"2026-07-06T14:31:38.001143Z","submitted_at":"2022-12-16T09:02:01Z","title":"Test-time Adaptation in the Dynamic World with Compound Domain Knowledge Management","version":3},"cited_work":{"arxiv_id":"2212.08356","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.08356","snapshot_observed_at":"2026-08-08T17:23:55.402462Z","title":"Test-time Adaptation in the Dynamic World with Compound Domain Knowledge Management","venue":"cs.CV","work_id":"59be982b-6239-4b39-bcf2-8fc7b0a8e755","year":2022},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.265348Z"},"links":{"cited_paper":"/paper/2212.08356","citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:7e1b9d4626ea243ab63e73ba886ee4a933fb310c111517ad1154b9947f51a84a","observation_id":"5c8119ec-326f-4eed-a9f3-daba2c567ee2","resolution":{"observed_at":"2026-08-08T17:23:55.407862Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.883865Z","title":"Efros, and Moritz Hardt","venue":null,"work_id":"cee6e72c-f731-421d-960c-f1b96734fd66","year":2020},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.269323Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:d4d0e6e0ef250e618c1414996b81e1ec8391b0be6a5e344e742139f3657d885b","observation_id":"e85034c2-b5d1-4039-b690-45b880216757","resolution":{"observed_at":"2026-08-08T17:23:55.887877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.872048Z","title":"Ward, Mark Kong, and Halyun Jeong","venue":null,"work_id":"451c2bc4-2a9e-4f95-affe-f6bccddff2b3","year":2023},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.272837Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:204e3906c2fc24f6725dd95763795fe604c1db4a5a63267dc135ba44510248d2","observation_id":"bcf1c10a-402f-4a9c-800b-24b2f3135d74","resolution":{"observed_at":"2026-08-08T17:23:55.875838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.276142Z","title":"van de Ven, Tinne Tuytelaars, and Andreas S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.276142Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:624fda347dc6dd8c9c0557fd8936e0a86966568f74d6deebf616509ccd0c5b5f","observation_id":"26f07ae3-e241-4874-b052-b950743b43b7","resolution":{"observed_at":"2026-08-08T17:23:55.276142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.860157Z","title":"Tent : Fully test-time adaptation by entropy minimization","venue":null,"work_id":"a3fa83d1-8f33-47db-9d05-2395c9f4184d","year":2021},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.278984Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:3b6dc5cb748fbf63318ae1cfa14649cc957b396cb5cfed960a901a5f06a23278","observation_id":"a33c56d7-0b13-40a7-8a33-66bafc677b7c","resolution":{"observed_at":"2026-08-08T17:23:55.864000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.848017Z","title":"Understanding gradual domain adaptation: Improved analysis, optimal path and beyond","venue":null,"work_id":"67b9683d-52b7-4f66-897a-e563fabd3a19","year":2022},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.282327Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:337eff5ed0e77afbe2637a15f6dc7ddf80e3b7f1c0bbc10ad82e4567e2a97730","observation_id":"10bad797-3a3c-4d99-8dee-aeef6e47b5be","resolution":{"observed_at":"2026-08-08T17:23:55.852148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.836670Z","title":"Continual test-time domain adaptation","venue":null,"work_id":"cb959a84-4e50-4006-8744-cf9fdfe9fddc","year":2022},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.285133Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:62b471c96f1897a618e0c65abe28db08b75f3f428890ce35d4c331fc21629445","observation_id":"11742923-6c24-40fd-85ab-99d85f0cfec5","resolution":{"observed_at":"2026-08-08T17:23:55.840391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:23:55.824884Z","title":"Curriculum learning by transfer learning: Theory and experiments with deep networks","venue":null,"work_id":"c1b7f96e-0e31-4ca1-9f50-09befced8d99","year":2018},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.288069Z"},"links":{"citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:61b6e71f150637bfab464161023ce1caafada1b37e7b205877613636d4093ef1","observation_id":"fb8385d6-3e23-422f-9920-78cd65e8e0d7","resolution":{"observed_at":"2026-08-08T17:23:55.828939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13460","last_updated":"2026-04-15T04:29:00Z","snapshot_observed_at":"2026-07-06T23:01:28.082506Z","submitted_at":"2026-04-15T04:29:00Z","title":"From Order to Distribution: A Spectral Characterization of Forgetting in Continual Learning","version":1},"cited_work":{"arxiv_id":"2604.13460","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.13460","snapshot_observed_at":"2026-08-08T17:23:55.743835Z","title":"From Order to Distribution: A Spectral Characterization of Forgetting in Continual Learning","venue":"cs.LG","work_id":"50a33a00-b38b-4715-88a5-0704283e8d60","year":2026},"citing_paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation","version":2},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-08-08T17:23:55.291013Z"},"links":{"cited_paper":"/paper/2604.13460","citing_paper":"/paper/2608.04927"},"observation_digest":"sha256:6f9c3b56cc30d8b6140b6eee14abdb012b22bccaa4c9270babdee85c29d7de1d","observation_id":"1d3e465a-9131-4ccf-b05b-63a3a0103293","resolution":{"observed_at":"2026-08-08T17:23:55.748087Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.04927","last_updated":"2026-08-06T04:53:44Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T11:10:45.619529Z","submitted_at":"2026-08-05T14:55:14Z","title":"Optimal Training-Time Scaling in Gradual Adaptation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":40,"verified_exact":4,"verified_fuzzy":55},"total_outbound_references":107},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 107 outbound references and 0 inbound Pith citation observations for arXiv:2608.04927."}