{"as_of":"2026-08-04T09:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7b0dde305ec99cdbc0b3eb1096ab2ef14ac6b4b3456bf39366767de697ceef60","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T05:27:10.359838Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-10T12:15:01.137692Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.04715","last_updated":"2025-08-19T09:45:25Z","snapshot_observed_at":"2026-07-06T20:48:05.131265Z","submitted_at":"2025-03-06T18:58:29Z","title":"Predictable Scale: Part I, Step Law -- Optimal Hyperparameter Scaling Law in Large Language Model Pretraining","version":7},"cited_work":{"arxiv_id":"2503.04715","doi":"10.48550/arxiv.2503.04715","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.04715","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Predictable scale: Part i–optimal hyperparameter scaling law in large language model pretraining","venue":null,"work_id":"dc2607d8-8c5c-41ec-a2af-c022c7c4d0ee","year":2025},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2503.04715","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:da8c9c290814976445ea8fbdd9be345d906585ed7ed1abd46014b12c5becc8f8","observation_id":"5d54bad5-dbfe-43d1-a3f7-0e20e17efeee","resolution":{"observed_at":"2026-05-22T00:05:47.673917Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04715","last_updated":"2025-08-19T09:45:25Z","snapshot_observed_at":"2026-07-06T20:48:05.131265Z","submitted_at":"2025-03-06T18:58:29Z","title":"Predictable Scale: Part I, Step Law -- Optimal Hyperparameter Scaling Law in Large Language Model Pretraining","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04715","snapshot_observed_at":"2026-08-03T05:27:10.359838Z","title":"Predictable scale: Part i, step law – optimal hyperparameter scaling law in large language model pretraining, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02472","last_updated":"2026-06-29T15:41:30Z","snapshot_observed_at":"2026-08-03T05:27:04.791799Z","submitted_at":"2026-02-02T18:52:52Z","title":"SPARKLING: Balancing Signal Preservation and Symmetry Breaking for Width-Progressive Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T05:27:10.359838Z"},"links":{"cited_paper":"/paper/2503.04715","citing_paper":"/paper/2602.02472"},"observation_digest":"sha256:b1e5aebe84739c4ca038f5c2e4c83d7b63fb84b68a7535a4fcc1899c3c835463","observation_id":"d0f628a8-daea-4fbf-8d14-e5bcf9243c97","resolution":{"observed_at":"2026-08-03T05:27:10.359838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04715","last_updated":"2025-08-19T09:45:25Z","snapshot_observed_at":"2026-07-06T20:48:05.131265Z","submitted_at":"2025-03-06T18:58:29Z","title":"Predictable Scale: Part I, Step Law -- Optimal Hyperparameter Scaling Law in Large Language Model Pretraining","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04715","snapshot_observed_at":"2026-08-03T04:14:00.828682Z","title":"Predictable scale: Part i -- optimal hyperparameter scaling law in large language model pretraining, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05711","last_updated":"2026-07-01T04:46:34Z","snapshot_observed_at":"2026-08-03T04:13:56.754896Z","submitted_at":"2026-02-05T14:37:32Z","title":"OmniMoE: An Efficient MoE by Orchestrating Atomic Experts at Scale","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-03T04:14:00.828682Z"},"links":{"cited_paper":"/paper/2503.04715","citing_paper":"/paper/2602.05711"},"observation_digest":"sha256:f4b0b45d004e243e369cdcb04a7aec66afb0dfba52c58c699936b043cd3c0f21","observation_id":"8e25eb6b-12cf-4bb2-9d36-37a8aecf8ea8","resolution":{"observed_at":"2026-08-03T04:14:00.828682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04715","last_updated":"2025-08-19T09:45:25Z","snapshot_observed_at":"2026-07-06T20:48:05.131265Z","submitted_at":"2025-03-06T18:58:29Z","title":"Predictable Scale: Part I, Step Law -- Optimal Hyperparameter Scaling Law in Large Language Model Pretraining","version":7},"cited_work":{"arxiv_id":"2503.04715","doi":"10.48550/arxiv.2503.04715","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.04715","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Predictable scale: Part i–optimal hyperparameter scaling law in large language model pretraining","venue":null,"work_id":"dc2607d8-8c5c-41ec-a2af-c022c7c4d0ee","year":2025},"citing_paper":{"arxiv_id":"2603.28743","last_updated":"2026-04-05T02:15:47Z","snapshot_observed_at":"2026-07-06T22:51:09.377351Z","submitted_at":"2026-03-30T17:51:47Z","title":"Rethinking Language Model Scaling under Transferable Hypersphere Optimization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-14T21:51:14.678941Z"},"links":{"cited_paper":"/paper/2503.04715","citing_paper":"/paper/2603.28743"},"observation_digest":"sha256:ef2722f62822c9eebc102772c70688bd6e1f2324aaefd941f65ec223e662b044","observation_id":"aa01726a-0612-4346-824f-30a2507a8b6f","resolution":{"observed_at":"2026-05-14T21:53:02.428845Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04715","last_updated":"2025-08-19T09:45:25Z","snapshot_observed_at":"2026-07-06T20:48:05.131265Z","submitted_at":"2025-03-06T18:58:29Z","title":"Predictable Scale: Part I, Step Law -- Optimal Hyperparameter Scaling Law in Large Language Model Pretraining","version":7},"cited_work":{"arxiv_id":"2503.04715","doi":"10.48550/arxiv.2503.04715","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.04715","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Predictable scale: Part i–optimal hyperparameter scaling law in large language model pretraining","venue":null,"work_id":"dc2607d8-8c5c-41ec-a2af-c022c7c4d0ee","year":2025},"citing_paper":{"arxiv_id":"2605.11518","last_updated":"2026-05-17T03:02:51Z","snapshot_observed_at":"2026-07-06T23:23:21.034839Z","submitted_at":"2026-05-12T04:42:35Z","title":"AutoLLMResearch: Training Research Agents for Automating LLM Experiment Configuration - Learning from Cheap, Optimizing Expensive","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-13T01:15:58.175350Z"},"links":{"cited_paper":"/paper/2503.04715","citing_paper":"/paper/2605.11518"},"observation_digest":"sha256:c9f5f2cad690da795cf5bea9034a5b4e6da99d247f6ec433a6ff9bc9cea71302","observation_id":"89c6de2c-1130-4202-8f08-e3cd7811a13d","resolution":{"observed_at":"2026-05-13T01:17:02.023735Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04715","last_updated":"2025-08-19T09:45:25Z","snapshot_observed_at":"2026-07-06T20:48:05.131265Z","submitted_at":"2025-03-06T18:58:29Z","title":"Predictable Scale: Part I, Step Law -- Optimal Hyperparameter Scaling Law in Large Language Model Pretraining","version":7},"cited_work":{"arxiv_id":"2503.04715","doi":"10.48550/arxiv.2503.04715","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.04715","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Predictable scale: Part i–optimal hyperparameter scaling law in large language model pretraining","venue":null,"work_id":"dc2607d8-8c5c-41ec-a2af-c022c7c4d0ee","year":2025},"citing_paper":{"arxiv_id":"2605.11518","last_updated":"2026-05-17T03:02:51Z","snapshot_observed_at":"2026-07-06T23:23:21.034839Z","submitted_at":"2026-05-12T04:42:35Z","title":"AutoLLMResearch: Training Research Agents for Automating LLM Experiment Configuration - Learning from Cheap, Optimizing Expensive","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-20T22:36:56.061187Z"},"links":{"cited_paper":"/paper/2503.04715","citing_paper":"/paper/2605.11518"},"observation_digest":"sha256:629d6c618bf1a4fba8b55097ef8c9cfe28f8b903efda7839450a5dd7e41b3643","observation_id":"c3d8b653-6d90-4b50-b188-c87cb9dda4be","resolution":{"observed_at":"2026-05-20T22:39:10.210596Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04715","last_updated":"2025-08-19T09:45:25Z","snapshot_observed_at":"2026-07-06T20:48:05.131265Z","submitted_at":"2025-03-06T18:58:29Z","title":"Predictable Scale: Part I, Step Law -- Optimal Hyperparameter Scaling Law in Large Language Model Pretraining","version":7},"cited_work":{"arxiv_id":"2503.04715","doi":"10.48550/arxiv.2503.04715","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.04715","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Predictable scale: Part i–optimal hyperparameter scaling law in large language model pretraining","venue":null,"work_id":"dc2607d8-8c5c-41ec-a2af-c022c7c4d0ee","year":2025},"citing_paper":{"arxiv_id":"2605.17000","last_updated":"2026-05-16T13:53:44Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T13:53:44Z","title":"BoLT: A Benchmark to Democratize Black-box Optimization Research for Expensive LLM Tasks","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-19T20:48:20.856172Z"},"links":{"cited_paper":"/paper/2503.04715","citing_paper":"/paper/2605.17000"},"observation_digest":"sha256:64b0dd44c9e816aff6b56bef12cf12b84a7b516dd14ef48edecffd38584bcf77","observation_id":"c272cd62-9e05-4b36-84e8-3bb687330044","resolution":{"observed_at":"2026-05-19T20:52:46.284908Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04715","last_updated":"2025-08-19T09:45:25Z","snapshot_observed_at":"2026-07-06T20:48:05.131265Z","submitted_at":"2025-03-06T18:58:29Z","title":"Predictable Scale: Part I, Step Law -- Optimal Hyperparameter Scaling Law in Large Language Model Pretraining","version":7},"cited_work":{"arxiv_id":"2503.04715","doi":"10.48550/arxiv.2503.04715","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.04715","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Predictable scale: Part i–optimal hyperparameter scaling law in large language model pretraining","venue":null,"work_id":"dc2607d8-8c5c-41ec-a2af-c022c7c4d0ee","year":2025},"citing_paper":{"arxiv_id":"2605.21486","last_updated":"2026-05-20T17:59:40Z","snapshot_observed_at":"2026-08-02T07:48:36.039760Z","submitted_at":"2026-05-20T17:59:40Z","title":"Quantifying Hyperparameter Transfer and the Importance of Embedding Layer Learning Rate","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T05:01:27.451161Z"},"links":{"cited_paper":"/paper/2503.04715","citing_paper":"/paper/2605.21486"},"observation_digest":"sha256:38b9d013f038b91828094333bd63143e6b4e006dbe7f80b81caaea35fbd71203","observation_id":"931597dd-a8b5-4142-8954-839468e0a7bc","resolution":{"observed_at":"2026-05-21T05:03:57.973859Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04715","last_updated":"2025-08-19T09:45:25Z","snapshot_observed_at":"2026-07-06T20:48:05.131265Z","submitted_at":"2025-03-06T18:58:29Z","title":"Predictable Scale: Part I, Step Law -- Optimal Hyperparameter Scaling Law in Large Language Model Pretraining","version":7},"cited_work":{"arxiv_id":"2503.04715","doi":"10.48550/arxiv.2503.04715","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.04715","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Predictable scale: Part i–optimal hyperparameter scaling law in large language model pretraining","venue":null,"work_id":"dc2607d8-8c5c-41ec-a2af-c022c7c4d0ee","year":2025},"citing_paper":{"arxiv_id":"2606.05186","last_updated":"2026-04-27T21:05:26Z","snapshot_observed_at":"2026-08-01T16:07:12.472735Z","submitted_at":"2026-04-27T21:05:26Z","title":"Staged Factorial Screening for Budget-Constrained Micro-Pretraining","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-01T08:39:46.699786Z"},"links":{"cited_paper":"/paper/2503.04715","citing_paper":"/paper/2606.05186"},"observation_digest":"sha256:2173e2c27b77784cf1216968914c8b8d868b3eab27b6525fe264f33a917ca68a","observation_id":"78f9b9c1-6564-4ea0-a71e-b01b07db99e1","resolution":{"observed_at":"2026-07-01T08:45:35.015335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04715","last_updated":"2025-08-19T09:45:25Z","snapshot_observed_at":"2026-07-06T20:48:05.131265Z","submitted_at":"2025-03-06T18:58:29Z","title":"Predictable Scale: Part I, Step Law -- Optimal Hyperparameter Scaling Law in Large Language Model Pretraining","version":7},"cited_work":{"arxiv_id":"2503.04715","doi":"10.48550/arxiv.2503.04715","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.04715","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Predictable scale: Part i–optimal hyperparameter scaling law in large language model pretraining","venue":null,"work_id":"dc2607d8-8c5c-41ec-a2af-c022c7c4d0ee","year":2025},"citing_paper":{"arxiv_id":"2606.05610","last_updated":"2026-06-04T02:32:11Z","snapshot_observed_at":"2026-07-06T23:45:33.157370Z","submitted_at":"2026-06-04T02:32:11Z","title":"Predictable Scaling Laws of Optimal Hyperparameters for LLM Continued Pre-training","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-28T01:53:04.715108Z"},"links":{"cited_paper":"/paper/2503.04715","citing_paper":"/paper/2606.05610"},"observation_digest":"sha256:fa62f861f9b01c0067525dc412078c175416dc5146005efcd9da529cc67ee1d7","observation_id":"a77351ce-5419-44df-8d6a-cae45a7be5d3","resolution":{"observed_at":"2026-07-02T12:46:56.731010Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04715","last_updated":"2025-08-19T09:45:25Z","snapshot_observed_at":"2026-07-06T20:48:05.131265Z","submitted_at":"2025-03-06T18:58:29Z","title":"Predictable Scale: Part I, Step Law -- Optimal Hyperparameter Scaling Law in Large Language Model Pretraining","version":7},"cited_work":{"arxiv_id":"2503.04715","doi":"10.48550/arxiv.2503.04715","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.04715","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Predictable scale: Part i–optimal hyperparameter scaling law in large language model pretraining","venue":null,"work_id":"dc2607d8-8c5c-41ec-a2af-c022c7c4d0ee","year":2025},"citing_paper":{"arxiv_id":"2606.15079","last_updated":"2026-06-13T03:21:49Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-13T03:21:49Z","title":"Ling and Ring 2.6 Technical Report: Efficient and Instant Agentic Intelligence at Trillion-Parameter Scale","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-07-02T22:10:59.568675Z"},"links":{"cited_paper":"/paper/2503.04715","citing_paper":"/paper/2606.15079"},"observation_digest":"sha256:4237e92e7b68f8d0e498f170c9b95375385825ef8665fe3277170fae306c66aa","observation_id":"b36f3396-bd91-48a9-827c-ec445c2739c4","resolution":{"observed_at":"2026-07-02T22:17:25.643954Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04715","last_updated":"2025-08-19T09:45:25Z","snapshot_observed_at":"2026-07-06T20:48:05.131265Z","submitted_at":"2025-03-06T18:58:29Z","title":"Predictable Scale: Part I, Step Law -- Optimal Hyperparameter Scaling Law in Large Language Model Pretraining","version":7},"cited_work":{"arxiv_id":"2503.04715","doi":"10.48550/arxiv.2503.04715","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.04715","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Predictable scale: Part i–optimal hyperparameter scaling law in large language model pretraining","venue":null,"work_id":"dc2607d8-8c5c-41ec-a2af-c022c7c4d0ee","year":2025},"citing_paper":{"arxiv_id":"2606.28057","last_updated":"2026-06-26T13:03:29Z","snapshot_observed_at":"2026-08-02T04:58:16.992176Z","submitted_at":"2026-06-26T13:03:29Z","title":"MultiHashFormer: Hash-based Generative Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-29T04:13:05.082903Z"},"links":{"cited_paper":"/paper/2503.04715","citing_paper":"/paper/2606.28057"},"observation_digest":"sha256:3fc2ad36b074e4b297bbc0cb18d15111b3bea3005661563fdad9e5a5932608c2","observation_id":"beb7a600-b152-4956-909c-b2676abab6d1","resolution":{"observed_at":"2026-06-29T04:23:05.586278Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04715","last_updated":"2025-08-19T09:45:25Z","snapshot_observed_at":"2026-07-06T20:48:05.131265Z","submitted_at":"2025-03-06T18:58:29Z","title":"Predictable Scale: Part I, Step Law -- Optimal Hyperparameter Scaling Law in Large Language Model Pretraining","version":7},"cited_work":{"arxiv_id":"2503.04715","doi":"10.48550/arxiv.2503.04715","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.04715","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Predictable scale: Part i–optimal hyperparameter scaling law in large language model pretraining","venue":null,"work_id":"dc2607d8-8c5c-41ec-a2af-c022c7c4d0ee","year":2025},"citing_paper":{"arxiv_id":"2606.29158","last_updated":"2026-06-28T02:42:47Z","snapshot_observed_at":"2026-07-31T21:24:10.379144Z","submitted_at":"2026-06-28T02:42:47Z","title":"On the Nonlinearity of Learning Rate Scaling for LLM Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T08:15:20.191222Z"},"links":{"cited_paper":"/paper/2503.04715","citing_paper":"/paper/2606.29158"},"observation_digest":"sha256:b1ad4e3af736bfd5355fd82d7c3646cd47c01c4fabaa94f54301e77de9c0ba18","observation_id":"23542f01-bb32-401a-9b90-90b1e45102bb","resolution":{"observed_at":"2026-06-30T08:24:26.775578Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04715","last_updated":"2025-08-19T09:45:25Z","snapshot_observed_at":"2026-07-06T20:48:05.131265Z","submitted_at":"2025-03-06T18:58:29Z","title":"Predictable Scale: Part I, Step Law -- Optimal Hyperparameter Scaling Law in Large Language Model Pretraining","version":7},"cited_work":{"arxiv_id":"2503.04715","doi":"10.48550/arxiv.2503.04715","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.04715","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Predictable scale: Part i–optimal hyperparameter scaling law in large language model pretraining","venue":null,"work_id":"dc2607d8-8c5c-41ec-a2af-c022c7c4d0ee","year":2025},"citing_paper":{"arxiv_id":"2607.01487","last_updated":"2026-07-01T21:32:14Z","snapshot_observed_at":"2026-07-07T00:07:04.211507Z","submitted_at":"2026-07-01T21:32:14Z","title":"How to Allocate Your Tokens? Scaling Laws with Training Steps and Batch Size","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-03T21:02:31.246432Z"},"links":{"cited_paper":"/paper/2503.04715","citing_paper":"/paper/2607.01487"},"observation_digest":"sha256:13ee096cf27d38f1c836b5904dff51beca0ae64289a263a62ce7cbdda9ec3211","observation_id":"9e8febb8-fbee-4d59-87cf-6fc4f48cb2cf","resolution":{"observed_at":"2026-07-03T21:08:57.606538Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04715","last_updated":"2025-08-19T09:45:25Z","snapshot_observed_at":"2026-07-06T20:48:05.131265Z","submitted_at":"2025-03-06T18:58:29Z","title":"Predictable Scale: Part I, Step Law -- Optimal Hyperparameter Scaling Law in Large Language Model Pretraining","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04715","snapshot_observed_at":"2026-08-01T15:33:19.545195Z","title":"Aixin Liu, Bei Feng, Bing Xue, Bingxuan Wang, Bochao Wu, Chengda Lu, Chenggang Zhao, Chengqi Deng, Chenyu Zhang, Chong Ruan, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18413","last_updated":"2026-07-20T18:02:25Z","snapshot_observed_at":"2026-08-02T20:07:46.906862Z","submitted_at":"2026-07-20T18:02:25Z","title":"Convolution for Large Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T15:33:19.545195Z"},"links":{"cited_paper":"/paper/2503.04715","citing_paper":"/paper/2607.18413"},"observation_digest":"sha256:f76b8a8cf9a3057c4b1d8fdb013ae7ee61693df3bf69d0dc196dc9ca13e18ab0","observation_id":"f9a9a766-4339-4587-a696-5daaaf3a386d","resolution":{"observed_at":"2026-08-01T15:33:19.545195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04715","last_updated":"2025-08-19T09:45:25Z","snapshot_observed_at":"2026-07-06T20:48:05.131265Z","submitted_at":"2025-03-06T18:58:29Z","title":"Predictable Scale: Part I, Step Law -- Optimal Hyperparameter Scaling Law in Large Language Model Pretraining","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04715","snapshot_observed_at":"2026-08-02T06:45:17.820219Z","title":"Predictable scale: Part i, step law– optimal hyperparameter scaling law in large language model pretraining.arXiv preprint arXiv:2503.04715, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:17.820219Z"},"links":{"cited_paper":"/paper/2503.04715","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:5d5c45426afe41e732549ed4519e244d927e41339fd8e55f7154eb6d6f126d0d","observation_id":"92ff9c0d-a7ff-4c5c-9f4c-26e6bab97084","resolution":{"observed_at":"2026-08-02T06:45:17.820219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04715","last_updated":"2025-08-19T09:45:25Z","snapshot_observed_at":"2026-07-06T20:48:05.131265Z","submitted_at":"2025-03-06T18:58:29Z","title":"Predictable Scale: Part I, Step Law -- Optimal Hyperparameter Scaling Law in Large Language Model Pretraining","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04715","snapshot_observed_at":"2026-08-03T01:29:04.360430Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28895","last_updated":"2026-07-30T23:27:14Z","snapshot_observed_at":"2026-08-04T09:33:53.783339Z","submitted_at":"2026-07-30T23:27:14Z","title":"LLM-Based Generative Retrieval for Snapchat Content Recommendation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T01:29:04.360430Z"},"links":{"cited_paper":"/paper/2503.04715","citing_paper":"/paper/2607.28895"},"observation_digest":"sha256:e067ed8b9754925e89747ec3b007ea26d2ac8ebe933f64b6cc0c36cbcd15e374","observation_id":"9a71e5f3-88c8-4657-8a6b-b9ed478aebca","resolution":{"observed_at":"2026-08-03T01:29:04.360430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2503.04715/citation-record","integrity":"/paper/2503.04715/integrity","json":"/paper/2503.04715/citation-record.json","paper":"/paper/2503.04715"},"outbound":[],"paper":{"arxiv_id":"2503.04715","last_updated":"2025-08-19T09:45:25Z","latest_version":7,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T20:48:05.131265Z","submitted_at":"2025-03-06T18:58:29Z","title":"Predictable Scale: Part I, Step Law -- Optimal Hyperparameter Scaling Law in Large Language Model Pretraining"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 17 inbound Pith citation observations for arXiv:2503.04715."}