{"as_of":"2026-08-10T21:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7125073b5625670eb3f98cb5a99efcc223bd6342b23663da3ad0727561c10398","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T17:17:00.114314Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T20:44:48.441119Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-08T20:44:48.658319Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"cited_work":{"arxiv_id":"2501.12486","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.12486","snapshot_observed_at":"2026-08-08T20:44:48.658319Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","venue":"cs.LG","work_id":"539097b9-d97e-40a2-9eb4-002bee21b4ff","year":2025},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T18:46:49.510936Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.441119Z"},"links":{"cited_paper":"/paper/2501.12486","citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:f1329aec673c56d31ffc0f8fee9f97303925cf04b8a2882ed86442b061ca311b","observation_id":"be29f8b8-dde7-43ba-8519-5dbca8c31da0","resolution":{"observed_at":"2026-08-08T20:44:48.662191Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.12486/citation-record","integrity":"/paper/2501.12486/integrity","json":"/paper/2501.12486/citation-record.json","paper":"/paper/2501.12486"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.04744","last_updated":"2024-02-07T10:55:59Z","snapshot_observed_at":"2026-08-10T20:45:51.921473Z","submitted_at":"2024-02-07T10:55:59Z","title":"Progressive Gradient Flow for Robust N:M Sparsity Training in Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04744","snapshot_observed_at":"2026-08-10T17:16:59.750276Z","title":"Progressive gradient flow for robust n:m sparsity training in transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T17:16:59.750276Z"},"links":{"cited_paper":"/paper/2402.04744","citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:3fd29b99ed24abeb1e80744a11647c62e60e1404c9af862a1a3fe92a6b4e4227","observation_id":"ce9ef419-260e-4283-aa1b-0a5107b71a07","resolution":{"observed_at":"2026-08-10T17:16:59.750276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:01.241367Z","title":"Scaling to very very large corpora for natural language disambiguation","venue":null,"work_id":"96c11ef3-e172-4795-97c1-a9c48574c734","year":2001},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T17:16:59.758530Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:1651459606d1dfd0c09f84777aa282c99244618dabddabc600c7b8e29883ebad","observation_id":"c9528b09-50c2-4c18-91d7-a832ce1f7951","resolution":{"observed_at":"2026-08-10T17:17:01.248876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:01.203702Z","title":"Data scaling laws in NMT : The effect of noise and architecture","venue":null,"work_id":"89ac8cb3-ff11-4a0d-987d-7f28979decd1","year":2022},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T17:16:59.765340Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:8799fc097443c5fca04c5f46630644049ac4447002d5fbe65ecac3249fa4343d","observation_id":"7156d400-e406-4431-9fac-e755958e10b8","resolution":{"observed_at":"2026-08-10T17:17:01.219679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01373","last_updated":"2023-05-31T17:54:07Z","snapshot_observed_at":"2026-08-07T23:49:29.478548Z","submitted_at":"2023-04-03T20:58:15Z","title":"Pythia: A Suite for Analyzing Large Language Models Across Training and Scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01373","snapshot_observed_at":"2026-08-10T17:16:59.772536Z","title":"Pythia: A suite for analyzing large language models across training and scaling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T17:16:59.772536Z"},"links":{"cited_paper":"/paper/2304.01373","citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:e3cab83d0d41a34d1c5818deb4ceaa7f53c5e909d93540536d083dae95210425","observation_id":"52aaac97-a2f7-4630-a828-ac7cfe0e7a9e","resolution":{"observed_at":"2026-08-10T17:16:59.772536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:01.159676Z","title":"Language models are few-shot learners","venue":null,"work_id":"ded0edef-55c3-4628-88b1-1b06889dae90","year":2020},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T17:16:59.779895Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:0838a4e2b1b2107d35d4ca04712e72854bf7c09ab6acfc4af36840c25bc931e8","observation_id":"8346fa33-7a86-49a0-ad3b-2f9f332f5561","resolution":{"observed_at":"2026-08-10T17:17:01.183455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:01.135754Z","title":"Maxtext: A framework for training large language models","venue":null,"work_id":"7430ab46-59d4-430f-a555-ff098aa4dc36","year":2024},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T17:16:59.786655Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:85fcd9e64d9eef95bf3a2927ad1d270ed8f1e1170b96f9dfc8aeabdd166a0f23","observation_id":"28a8bd68-561d-49a5-b373-78f702202d9d","resolution":{"observed_at":"2026-08-10T17:17:01.144782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:01.111569Z","title":"Rigging the lottery: Making all tickets winners","venue":null,"work_id":"6c49c536-df5d-4d3c-bd0a-3b39ba7acabb","year":2020},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T17:16:59.793479Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:7ae37312446504b4967f4b22a66f67a5bc38afa83ce7131f82983fcab578631a","observation_id":"4f251a5c-7200-4f73-8e9a-db254ccdf6c7","resolution":{"observed_at":"2026-08-10T17:17:01.118432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:59.802953Z","title":"The lottery ticket hypothesis: Finding sparse, trainable neural networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T17:16:59.802953Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:c5faa059e2d08c67fd8e157a961bef09826dc280a753591056abcba31c1fd6b9","observation_id":"8ae5c608-9276-4e89-b23f-d3b75a19057b","resolution":{"observed_at":"2026-08-10T17:16:59.802953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:01.067080Z","title":"Roy, and Michael Carbin","venue":null,"work_id":"8b7a89a1-56ab-4639-9b05-cda679185098","year":2019},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T17:16:59.809967Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:9dcf35918814845ed73fd721e9c74d2f5850045b7d98297044789e7bf6bfd3cc","observation_id":"a653bcc9-d401-4d34-8e32-f7c4e9736e36","resolution":{"observed_at":"2026-08-10T17:17:01.074493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00774","last_updated":"2023-03-22T12:33:46Z","snapshot_observed_at":"2026-08-06T23:32:44.248222Z","submitted_at":"2023-01-02T17:48:56Z","title":"SparseGPT: Massive Language Models Can Be Accurately Pruned in One-Shot","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00774","snapshot_observed_at":"2026-08-10T17:16:59.816539Z","title":"Sparsegpt: Massive language models can be accurately pruned in one-shot","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T17:16:59.816539Z"},"links":{"cited_paper":"/paper/2301.00774","citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:b09343ce1f308657e4ca8431b009e658e0e1dab277222bfa4921705418a18bd6","observation_id":"7bad8e8b-5cc5-4aa9-98c5-df1b08d312d1","resolution":{"observed_at":"2026-08-10T17:16:59.816539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:01.040441Z","title":"Scaling laws for sparsely-connected foundation models","venue":null,"work_id":"818cf66c-6e45-4992-8a14-e1b9319502f7","year":2024},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T17:16:59.824374Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:f3f0df443d0736fb7741a45c3cd672409bcf07d978a9851466339d96a7bab088","observation_id":"a9ac1616-ed28-4232-b787-54cc007102b0","resolution":{"observed_at":"2026-08-10T17:17:01.051629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.09574","last_updated":"2019-02-25T19:18:40Z","snapshot_observed_at":"2026-08-06T16:38:23.884750Z","submitted_at":"2019-02-25T19:18:40Z","title":"The State of Sparsity in Deep Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.09574","snapshot_observed_at":"2026-08-10T17:16:59.831134Z","title":"The state of sparsity in deep neural networks","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T17:16:59.831134Z"},"links":{"cited_paper":"/paper/1902.09574","citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:18183950b600207d6577f6dede9a48346c803522e8feb7d2182164accdb46e0e","observation_id":"4eca3aca-c646-42d9-ae2c-0888e1a9bcaf","resolution":{"observed_at":"2026-08-10T17:16:59.831134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:01.016212Z","title":"Scaling laws for neural machine translation","venue":null,"work_id":"0814e75f-8471-455e-b6e2-4d43a8c8296e","year":2022},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T17:16:59.838292Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:f2ec4b8fd7f556cd5c24d96909ca5c1a432557026b3b155227099e1f97f8e7a0","observation_id":"5eef64b4-c40c-4770-bed9-e7b5ffcb7273","resolution":{"observed_at":"2026-08-10T17:17:01.023635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"cs.cl/0108005","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:00.379542Z","title":"A bit of progress in language modeling","venue":null,"work_id":"76c1c7b9-8da9-407b-83ff-927ea6faf79b","year":2001},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T17:16:59.846701Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:cf2a31e4b3ce25fc2934bdd3cafff8650d8bba1701d589ad6a548bc789322637","observation_id":"f13d3e0f-28a6-48fa-8fe0-ad918ca095b7","resolution":{"observed_at":"2026-08-10T17:17:00.393001Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:00.996675Z","title":"Data and parameter scaling laws for neural machine translation","venue":null,"work_id":"2410c616-79b2-4370-a25e-e68b3a01274f","year":2021},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T17:16:59.854996Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:79bfd2d775d8f7f514dd5a97063cf21b985f1389f6f7ea6f3455229e20ea138a","observation_id":"03a3b10c-41b7-4079-a90d-12520cad9d84","resolution":{"observed_at":"2026-08-10T17:17:01.002645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T17:16:59.861295Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T17:16:59.861295Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:43baf2d114fff15dedad1803413b91c6b422c1ee95bb27e1b64e8be89acc828e","observation_id":"09d58f16-439b-430a-a611-9e0aebde9244","resolution":{"observed_at":"2026-08-10T17:16:59.861295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:00.970346Z","title":"OLM o: Accelerating the science of language models","venue":null,"work_id":"9ac58c09-5d81-4e20-9d6e-4aa318802e32","year":2024},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T17:16:59.872152Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:e8fd24d104f1ab20a7e1d73b4a7e946f7459b6fc91866b22a354f4858f3bb868","observation_id":"0d230d64-ca76-4445-826c-98b3d6806e51","resolution":{"observed_at":"2026-08-10T17:17:00.981103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:00.948879Z","title":null,"venue":null,"work_id":"0b68ddc3-1728-4e35-a14e-0d386afd2078","year":2015},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T17:16:59.882300Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:084134e420b8812de01a63ae170a3f2cb30bcbb7232b814db67cd44aea045bc1","observation_id":"ab8b59cf-004c-4efe-b35c-535996ab21d0","resolution":{"observed_at":"2026-08-10T17:17:00.954867Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:00.926786Z","title":"Hassibi, D.G","venue":null,"work_id":"0c18fa28-7510-4615-8eb5-838da6739c55","year":1993},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T17:16:59.888823Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:9ccf825b848e8dd79436dbb8d4d33a76b5df3e289ae873e765f539cd143dfb58","observation_id":"a9b99fb7-c20a-4bef-abc8-b0aaba0784b7","resolution":{"observed_at":"2026-08-10T17:17:00.933243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:00.902770Z","title":"Channel pruning for accelerating very deep neural networks","venue":null,"work_id":"1f3f4399-692d-4ca4-bde4-1a1133d8f9f6","year":2017},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T17:16:59.895169Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:02320566bb795a546f5e55f3bdd6341144d246532233d9d90962bc955f4300ab","observation_id":"24ffe59a-d148-4b01-a98c-3f17e98f40c8","resolution":{"observed_at":"2026-08-10T17:17:00.909558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:00.884333Z","title":"Rae, and Laurent Sifre","venue":null,"work_id":"b8821cc9-187e-4777-be7a-b111f909eba5","year":2024},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T17:16:59.900702Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:2472349361133856a6e03f3dbaa9569970b9fa2b607e1bf9253a62f7badd2470","observation_id":"86361b72-1253-44c1-bb09-e59a79836d7a","resolution":{"observed_at":"2026-08-10T17:17:00.889938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:00.865706Z","title":"Roy, Jonathan Frankle, and Gintare Karolina Dziugaite","venue":null,"work_id":"12e90eec-7cf2-4285-ac36-ea3cd1eb6222","year":2022},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T17:16:59.906464Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:a15362a1bcce3c3f12671e52ae9f1958bdda78fd93dafb7f10ba430ee8e1b72c","observation_id":"0a45dba8-44d0-4069-906f-4ebc9ce1e0ac","resolution":{"observed_at":"2026-08-10T17:17:00.871425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-10T17:16:59.912276Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T17:16:59.912276Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:afad20605cc315e04439cd72c81f1cc7b07a0ce49dd30563e40a8abe8d2a289b","observation_id":"6eede097-3a48-49eb-a575-518a720a226a","resolution":{"observed_at":"2026-08-10T17:16:59.912276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:00.843487Z","title":"Accurate neural network pruning requires rethinking sparse optimization","venue":null,"work_id":"0b1314d7-a0f4-4ff9-babc-f127f3c2ea4a","year":2024},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T17:16:59.919879Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:759d175f7fb135474cfef734e8a35f98788da3fb870279a855474516011421e8","observation_id":"b082d7c6-63d5-435f-a286-a1a3a199f23c","resolution":{"observed_at":"2026-08-10T17:17:00.849992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:00.821389Z","title":"Optimal brain damage","venue":null,"work_id":"3ffb035b-5a41-42a1-b884-74666907d443","year":1989},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T17:16:59.928811Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:29caed8e70cf1fb78aa5394f36a89142979361fefd125317312ac987bd590f7a","observation_id":"10c1ef59-edad-41e5-bc5d-410c336c6aaa","resolution":{"observed_at":"2026-08-10T17:17:00.827869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:00.795399Z","title":"Liu and Jorge Nocedal","venue":null,"work_id":"75e2e106-a895-4001-a25e-6f60c5df83f9","year":1989},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T17:16:59.937495Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:5d871ea7dc3317697ed2d29795afd1299a98804bccb8d8ec2f0aebd9642139b0","observation_id":"be89fc12-e283-473f-99f5-e9b0f974ecf4","resolution":{"observed_at":"2026-08-10T17:17:00.801977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:00.776910Z","title":"Step: learning n:m structured sparsity masks from scratch with precondition","venue":null,"work_id":"08d07972-53ee-48b4-a6d1-a84f23cfd999","year":2023},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T17:16:59.945271Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:647dc2046dd69da283ca8c4e3fef184dc6cc25e67cbfeee724f72ef6bbedcab5","observation_id":"d9cacea0-5b4f-4c4b-88b3-4f4ff7b30cb2","resolution":{"observed_at":"2026-08-10T17:17:00.782868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:00.755802Z","title":"Deep double descent: Where bigger models and more data hurt","venue":null,"work_id":"b1ea6626-d9f9-43d2-8904-9b4ab64a4852","year":2020},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T17:16:59.952581Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:74d420c17c9862444adc48ec6392eac7b2e56d197dbbd90a083084cecba229d6","observation_id":"bfd94445-578b-44a4-b1fd-91aec21b718c","resolution":{"observed_at":"2026-08-10T17:17:00.762746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05913","last_updated":"2024-10-13T19:35:21Z","snapshot_observed_at":"2026-08-08T23:15:41.966258Z","submitted_at":"2024-02-08T18:49:09Z","title":"Efficient Stagewise Pretraining via Progressive Subnetworks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05913","snapshot_observed_at":"2026-08-10T17:16:59.963976Z","title":"Efficient stagewise pretraining via progressive subnetworks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T17:16:59.963976Z"},"links":{"cited_paper":"/paper/2402.05913","citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:0e2b74d0f2224fcc86531331135b7d8fb9e67527228786854a34d34401cf2e90","observation_id":"71129094-cad7-4543-b03e-c1f061da146c","resolution":{"observed_at":"2026-08-10T17:16:59.963976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:00.737161Z","title":"Larsen, Jonathan Frankle, Surya Ganguli, and Gintare Karolina Dziugaite","venue":null,"work_id":"c178a1ad-ce81-4a43-b363-068f2d81a741","year":2023},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T17:16:59.973612Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:e45209ef87a1a85569ae8d812b300e05f0dc0ce726104be4d3012b91b426defc","observation_id":"07ce358e-d6a6-4c51-8bb7-a13241a96faf","resolution":{"observed_at":"2026-08-10T17:17:00.742715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:00.714639Z","title":"AC / DC : Alternating compressed/decompressed training of deep neural networks","venue":null,"work_id":"84497990-a7bb-4a56-9c4e-bbde9ac4633f","year":2021},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T17:16:59.980118Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:e1c218386de6d9629034059bfe6595908e17bb959bd6c506b3c7791484458877","observation_id":"7bc78c98-6da9-4506-8516-46f7dabf842c","resolution":{"observed_at":"2026-08-10T17:17:00.721218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:00.696117Z","title":null,"venue":null,"work_id":"72605cb8-cd9a-4480-9c9d-b6fde9edd581","year":2020},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T17:16:59.986686Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:bb393f00a350d8aecd8a3dc0b985a1a3d3d07ebacff559199c400de3f32e6e44","observation_id":"8a636485-d803-4ceb-9350-1f3db6eea43c","resolution":{"observed_at":"2026-08-10T17:17:00.702200Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:00.677932Z","title":"Comparing rewinding and fine-tuning in neural network pruning","venue":null,"work_id":"ff451c37-8509-40e2-bb9c-8b18b98b0df0","year":2020},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T17:16:59.995673Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:d1816cafab666e88e5b1af90a6acfc2f314bf5f598666f3ff9189c5ff07b6510","observation_id":"42a17963-76f5-4f1c-ad46-b8f66109493c","resolution":{"observed_at":"2026-08-10T17:17:00.683346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:00.657600Z","title":"On the predictability of pruning across scales","venue":null,"work_id":"12f0ed48-ac07-4715-9960-8e0668c2d5a1","year":2021},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T17:17:00.002162Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:f7e07460fe00de5b204531709b1070c414e58c04f5e60705f945024f82018890","observation_id":"52213121-9f54-4082-8198-b3768486833c","resolution":{"observed_at":"2026-08-10T17:17:00.664019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:00.637187Z","title":"Creating sparse gpt-3 models with iterative pruning","venue":null,"work_id":"8fcb7312-d747-4865-9a69-416633232737","year":2022},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T17:17:00.012910Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:4c806a971eb4648a92e0de976912cb92d4953bc90dca1238e37e11a5f2896987","observation_id":"4d5e24ad-e14b-4e7e-a2f3-2e1693b67378","resolution":{"observed_at":"2026-08-10T17:17:00.643198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:00.617012Z","title":"Beyond chinchilla-optimal: Accounting for inference in language model scaling laws","venue":null,"work_id":"ecabf65a-cedd-44ca-b593-db145d1ae213","year":2024},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T17:17:00.021734Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:e38f4dcb85d9afc4cbd6c983424ab2fb7b0ef4efa49b6325b19dea6130251d5f","observation_id":"0d106158-7be4-414a-a0e6-f4d78520ad2f","resolution":{"observed_at":"2026-08-10T17:17:00.622880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-10T17:17:00.032815Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T17:17:00.032815Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:475a95c6005958dff15b528f2452a0382c61ed4743771f45b706320ae89072c3","observation_id":"bd0b05eb-44a7-4faa-ba56-b4e036b379c4","resolution":{"observed_at":"2026-08-10T17:17:00.032815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:00.597962Z","title":"A simple and effective pruning approach for large language models","venue":null,"work_id":"a3781a35-63f6-419a-9c73-f062eb4b68b0","year":2024},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T17:17:00.041648Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:27904666a715bd23062efc5705e63016eaa29576413d8c0debdf2f3659a8f0a5","observation_id":"9097ced0-efcd-4c0d-9a84-1cfe77d6aaf4","resolution":{"observed_at":"2026-08-10T17:17:00.603837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T17:17:00.053314Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T17:17:00.053314Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:99c1aed5dc4bdd7a404f61cffd891ff5c184cba50a049a0bfc084635a3d678cb","observation_id":"9532bd64-8d83-489f-8a03-ec3b80573d42","resolution":{"observed_at":"2026-08-10T17:17:00.053314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06694","last_updated":"2024-04-11T01:18:06Z","snapshot_observed_at":"2026-08-08T20:21:38.269492Z","submitted_at":"2023-10-10T15:13:30Z","title":"Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06694","snapshot_observed_at":"2026-08-10T17:17:00.060950Z","title":"Sheared llama: Accelerating language model pre-training via structured pruning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T17:17:00.060950Z"},"links":{"cited_paper":"/paper/2310.06694","citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:acbc568255a42ec7eab455d9f24b834613f3b390cdbb95261cb0712612f5d4f8","observation_id":"ef670600-49db-4bcd-a463-d569c7db7785","resolution":{"observed_at":"2026-08-10T17:17:00.060950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:00.577279Z","title":"Step: Staged parameter-efficient pre-training for large language models","venue":null,"work_id":"03a2517f-43d1-4416-bf38-487d417ecc74","year":2024},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T17:17:00.068020Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:f538102e08e131061035bafe0aac01f8123a068e4db8baeee45a3d7566f18990","observation_id":"1302555c-d9c4-4f5b-99a4-ab07679ad2a4","resolution":{"observed_at":"2026-08-10T17:17:00.584714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:00.556057Z","title":"Masked structural growth for 2x faster language model pre-training","venue":null,"work_id":"b649982d-4fcc-4d4f-9cfd-de3a454bcf3f","year":2024},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T17:17:00.074557Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:3d480d15be3e658945d72706b9dab61df1ac019a533a747c4ea34612b4ff512c","observation_id":"05875338-c573-416e-8b4b-bc885dba8c09","resolution":{"observed_at":"2026-08-10T17:17:00.564110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.01878","last_updated":"2017-11-13T18:40:16Z","snapshot_observed_at":"2026-08-05T00:54:50.482913Z","submitted_at":"2017-10-05T04:26:49Z","title":"To prune, or not to prune: exploring the efficacy of pruning for model compression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.01878","snapshot_observed_at":"2026-08-10T17:17:00.080795Z","title":"To prune, or not to prune: exploring the efficacy of pruning for model compression","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T17:17:00.080795Z"},"links":{"cited_paper":"/paper/1710.01878","citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:13449b526d5900bb28971127a70648b8ee58e689412b6e1d579c9f5e9462e1b2","observation_id":"5b8abaec-5155-4d34-a2b1-d90e3f19736b","resolution":{"observed_at":"2026-08-10T17:17:00.080795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:00.090198Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T17:17:00.090198Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:3e64bd256f082c770c2e62209419e44d861eaffb0dcb082a6d558625f8c3a65c","observation_id":"8bb11f40-05a0-45f6-9b66-10bbc0a1aece","resolution":{"observed_at":"2026-08-10T17:17:00.090198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:00.096909Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T17:17:00.096909Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:ddee39c311f3dbc352fc4532fa2cd9824b5cf4b3f22d042d5f3b8c1db5f16b58","observation_id":"f655db2a-d1c5-43e6-aadb-7b6bcab2a6c4","resolution":{"observed_at":"2026-08-10T17:17:00.096909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:00.102574Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T17:17:00.102574Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:6407e25bc778c6f9f4705846b89fdce66990d3b4a7a143faac090680e8211826","observation_id":"1045d6bf-01f8-4215-b817-2a579dbdeb83","resolution":{"observed_at":"2026-08-10T17:17:00.102574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:17:00.114314Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T17:17:00.114314Z"},"links":{"citing_paper":"/paper/2501.12486"},"observation_digest":"sha256:0d0851326c80408ccfe2e1d8382c2d31be423cb03a85a8911bf0830e200c0589","observation_id":"a1705959-45eb-49f7-9703-de5493a14c13","resolution":{"observed_at":"2026-08-10T17:17:00.114314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T20:47:27.703489Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":1,"verified_fuzzy":28},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 1 inbound Pith citation observation for arXiv:2501.12486."}