{"as_of":"2026-08-07T23:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d992f8f2dbe4815daa49046493f67b231e5c92b5afc7a4692315410bc5747380","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":7,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":7,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:48:55.089882Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":2,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.15156","last_updated":"2025-02-14T04:54:23Z","snapshot_observed_at":"2026-07-06T19:20:32.349889Z","submitted_at":"2024-09-23T16:04:03Z","title":"Rethinking Conventional Wisdom in Machine Learning: From Generalization to Scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15156","snapshot_observed_at":"2026-08-06T20:48:55.089882Z","title":"Rethinking conventional wisdom in machine learning: From generalization to scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:55.089882Z"},"links":{"cited_paper":"/paper/2409.15156","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:8cb5ad8eb742973b9c72dc7e87ea8b2cbe74216490834b7f4281101a9fabfdb7","observation_id":"daf49d49-f471-46bf-8352-787c0b0f9991","resolution":{"observed_at":"2026-08-06T20:48:55.089882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15156","last_updated":"2025-02-14T04:54:23Z","snapshot_observed_at":"2026-07-06T19:20:32.349889Z","submitted_at":"2024-09-23T16:04:03Z","title":"Rethinking Conventional Wisdom in Machine Learning: From Generalization to Scaling","version":2},"cited_work":{"arxiv_id":"2409.15156","doi":"10.48550/arxiv.2409.15156","metadata_source":"arxiv_reference","pith_arxiv_id":"2409.15156","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ArXiv Preprint: 2409.15156 , Year =","venue":"arXiv (Cornell University)","work_id":"26c08f78-ce3d-40da-8b82-ff9dab86e5e7","year":2024},"citing_paper":{"arxiv_id":"2508.17784","last_updated":"2026-04-12T14:04:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T08:26:43Z","title":"Proximal Supervised Fine-Tuning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T20:42:14.423836Z"},"links":{"cited_paper":"/paper/2409.15156","citing_paper":"/paper/2508.17784"},"observation_digest":"sha256:2cee8ea202de71df0a95dddf32cc248fb77ce4c4b4f9e7bd92e5674a14a40f39","observation_id":"24be7fbe-5afa-4084-82cf-c93fe5e8a55a","resolution":{"observed_at":"2026-05-18T20:42:50.938439Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15156","last_updated":"2025-02-14T04:54:23Z","snapshot_observed_at":"2026-07-06T19:20:32.349889Z","submitted_at":"2024-09-23T16:04:03Z","title":"Rethinking Conventional Wisdom in Machine Learning: From Generalization to Scaling","version":2},"cited_work":{"arxiv_id":"2409.15156","doi":"10.48550/arxiv.2409.15156","metadata_source":"arxiv_reference","pith_arxiv_id":"2409.15156","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ArXiv Preprint: 2409.15156 , Year =","venue":"arXiv (Cornell University)","work_id":"26c08f78-ce3d-40da-8b82-ff9dab86e5e7","year":2024},"citing_paper":{"arxiv_id":"2604.20244","last_updated":"2026-04-22T06:46:22Z","snapshot_observed_at":"2026-07-06T23:06:44.624357Z","submitted_at":"2026-04-22T06:46:22Z","title":"Hybrid Policy Distillation for LLMs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-10T00:41:21.984760Z"},"links":{"cited_paper":"/paper/2409.15156","citing_paper":"/paper/2604.20244"},"observation_digest":"sha256:08a08c64a6763f042da7a74745ba82c20b1973eb04d556123632330d5f150a96","observation_id":"527004a7-5077-456c-b76c-e82b561cccf9","resolution":{"observed_at":"2026-05-10T00:54:49.094867Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15156","last_updated":"2025-02-14T04:54:23Z","snapshot_observed_at":"2026-07-06T19:20:32.349889Z","submitted_at":"2024-09-23T16:04:03Z","title":"Rethinking Conventional Wisdom in Machine Learning: From Generalization to Scaling","version":2},"cited_work":{"arxiv_id":"2409.15156","doi":"10.48550/arxiv.2409.15156","metadata_source":"arxiv_reference","pith_arxiv_id":"2409.15156","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ArXiv Preprint: 2409.15156 , Year =","venue":"arXiv (Cornell University)","work_id":"26c08f78-ce3d-40da-8b82-ff9dab86e5e7","year":2024},"citing_paper":{"arxiv_id":"2605.11172","last_updated":"2026-05-11T19:30:47Z","snapshot_observed_at":"2026-07-06T23:23:02.025664Z","submitted_at":"2026-05-11T19:30:47Z","title":"Optimistic Dual Averaging Unifies Modern Optimizers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T05:52:16.805180Z"},"links":{"cited_paper":"/paper/2409.15156","citing_paper":"/paper/2605.11172"},"observation_digest":"sha256:1216811342574aab32399af89df5c568c1caf0aac9b23c72ac45d08f95c75c86","observation_id":"ce67e99d-b37c-4c07-87fd-1c75f94b1a39","resolution":{"observed_at":"2026-05-13T05:52:21.820665Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15156","last_updated":"2025-02-14T04:54:23Z","snapshot_observed_at":"2026-07-06T19:20:32.349889Z","submitted_at":"2024-09-23T16:04:03Z","title":"Rethinking Conventional Wisdom in Machine Learning: From Generalization to Scaling","version":2},"cited_work":{"arxiv_id":"2409.15156","doi":"10.48550/arxiv.2409.15156","metadata_source":"arxiv_reference","pith_arxiv_id":"2409.15156","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ArXiv Preprint: 2409.15156 , Year =","venue":"arXiv (Cornell University)","work_id":"26c08f78-ce3d-40da-8b82-ff9dab86e5e7","year":2024},"citing_paper":{"arxiv_id":"2605.18528","last_updated":"2026-05-31T14:16:59Z","snapshot_observed_at":"2026-07-06T23:29:24.494326Z","submitted_at":"2026-05-18T15:13:18Z","title":"Scale-Invariant Neural Network Optimization: Norm Geometry and Heavy-Tailed Noise","version":1},"reference_index":133,"source":"arxiv_source","source_observed_at":"2026-05-20T08:48:42.019359Z"},"links":{"cited_paper":"/paper/2409.15156","citing_paper":"/paper/2605.18528"},"observation_digest":"sha256:fd600fd558d1da77f7069e1d1f6825ee4506c28b507170d3c69bed6964165d14","observation_id":"b377593c-9c5e-46a3-b080-5196e00c8f74","resolution":{"observed_at":"2026-05-20T08:53:24.521254Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15156","last_updated":"2025-02-14T04:54:23Z","snapshot_observed_at":"2026-07-06T19:20:32.349889Z","submitted_at":"2024-09-23T16:04:03Z","title":"Rethinking Conventional Wisdom in Machine Learning: From Generalization to Scaling","version":2},"cited_work":{"arxiv_id":"2409.15156","doi":"10.48550/arxiv.2409.15156","metadata_source":"arxiv_reference","pith_arxiv_id":"2409.15156","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ArXiv Preprint: 2409.15156 , Year =","venue":"arXiv (Cornell University)","work_id":"26c08f78-ce3d-40da-8b82-ff9dab86e5e7","year":2024},"citing_paper":{"arxiv_id":"2605.18528","last_updated":"2026-05-31T14:16:59Z","snapshot_observed_at":"2026-07-06T23:29:24.494326Z","submitted_at":"2026-05-18T15:13:18Z","title":"Scale-Invariant Neural Network Optimization: Norm Geometry and Heavy-Tailed Noise","version":2},"reference_index":124,"source":"arxiv_source","source_observed_at":"2026-06-30T18:27:40.390908Z"},"links":{"cited_paper":"/paper/2409.15156","citing_paper":"/paper/2605.18528"},"observation_digest":"sha256:7b0c0325b0a515528fcc0d03e44304fd6cfd9a9675142963de5880269a5c5c82","observation_id":"010fdcdb-907d-4be6-867d-88901900660e","resolution":{"observed_at":"2026-07-01T14:55:48.592221Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15156","last_updated":"2025-02-14T04:54:23Z","snapshot_observed_at":"2026-07-06T19:20:32.349889Z","submitted_at":"2024-09-23T16:04:03Z","title":"Rethinking Conventional Wisdom in Machine Learning: From Generalization to Scaling","version":2},"cited_work":{"arxiv_id":"2409.15156","doi":"10.48550/arxiv.2409.15156","metadata_source":"arxiv_reference","pith_arxiv_id":"2409.15156","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ArXiv Preprint: 2409.15156 , Year =","venue":"arXiv (Cornell University)","work_id":"26c08f78-ce3d-40da-8b82-ff9dab86e5e7","year":2024},"citing_paper":{"arxiv_id":"2605.29303","last_updated":"2026-05-28T03:36:05Z","snapshot_observed_at":"2026-08-02T10:09:28.694342Z","submitted_at":"2026-05-28T03:36:05Z","title":"Entropy-KL Divergence-based Token Masking: A Novel Approach for Selective Fine-tuning of Large Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-29T08:01:39.412431Z"},"links":{"cited_paper":"/paper/2409.15156","citing_paper":"/paper/2605.29303"},"observation_digest":"sha256:b766c48b1c0d1a24342f3bcae98b1ba64d36b60c9dfe2fdf3ea8ca70d3041a1e","observation_id":"4db49b23-7097-4ab0-bdba-ff97cab57064","resolution":{"observed_at":"2026-06-29T08:03:13.498564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2409.15156/citation-record","integrity":"/paper/2409.15156/integrity","json":"/paper/2409.15156/citation-record.json","paper":"/paper/2409.15156"},"outbound":[],"paper":{"arxiv_id":"2409.15156","last_updated":"2025-02-14T04:54:23Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T19:20:32.349889Z","submitted_at":"2024-09-23T16:04:03Z","title":"Rethinking Conventional Wisdom in Machine Learning: From Generalization to Scaling"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 7 inbound Pith citation observations for arXiv:2409.15156."}