{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:YTTGGQ5DVYAYLPO5Y7DOEKVW2L","short_pith_number":"pith:YTTGGQ5D","schema_version":"1.0","canonical_sha256":"c4e66343a3ae0185bdddc7c6e22ab6d2dc041ac14b29f246b3e7704244ec73ec","source":{"kind":"arxiv","id":"2405.10938","version":3},"attestation_state":"computed","paper":{"title":"Observational Scaling Laws and the Predictability of Language Model Performance","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.CL","stat.ML"],"primary_cat":"cs.LG","authors_text":"Chris J. Maddison, Tatsunori Hashimoto, Yangjun Ruan","submitted_at":"2024-05-17T17:49:44Z","abstract_excerpt":"Understanding how language model performance varies with scale is critical to benchmark and algorithm development. Scaling laws are one approach to building this understanding, but the requirement of training models across many different scales has limited their use. We propose an alternative, observational approach that bypasses model training and instead builds scaling laws from ~100 publically available models. Building a single scaling law from multiple model families is challenging due to large variations in their training compute efficiencies and capabilities. However, we show that these"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2405.10938","kind":"arxiv","version":3},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2024-05-17T17:49:44Z","cross_cats_sorted":["cs.AI","cs.CL","stat.ML"],"title_canon_sha256":"b2029229e15f370d478a117bdc16f330d34cc2cec15ba4a61c18d9ffdee66e33","abstract_canon_sha256":"1fdbe0dd2ebe58c26da2ae12d98d4b3af9142dcdc396bfac1b91e35e7deed941"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:14:32.853389Z","signature_b64":"rX0e9Kc2/1ntFxnJhjkZeuIG1qTM6DMeEObRopHYKHWDgMiAoICU0LxW/QpDxFf2oAOX2U3MYuxhSSKzwkmqAA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"c4e66343a3ae0185bdddc7c6e22ab6d2dc041ac14b29f246b3e7704244ec73ec","last_reissued_at":"2026-07-05T09:14:32.852936Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:14:32.852936Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Observational Scaling Laws and the Predictability of Language Model Performance","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.CL","stat.ML"],"primary_cat":"cs.LG","authors_text":"Chris J. Maddison, Tatsunori Hashimoto, Yangjun Ruan","submitted_at":"2024-05-17T17:49:44Z","abstract_excerpt":"Understanding how language model performance varies with scale is critical to benchmark and algorithm development. Scaling laws are one approach to building this understanding, but the requirement of training models across many different scales has limited their use. We propose an alternative, observational approach that bypasses model training and instead builds scaling laws from ~100 publically available models. Building a single scaling law from multiple model families is challenging due to large variations in their training compute efficiencies and capabilities. However, we show that these"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2405.10938","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2405.10938/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2405.10938","created_at":"2026-07-05T09:14:32.852994+00:00"},{"alias_kind":"arxiv_version","alias_value":"2405.10938v3","created_at":"2026-07-05T09:14:32.852994+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2405.10938","created_at":"2026-07-05T09:14:32.852994+00:00"},{"alias_kind":"pith_short_12","alias_value":"YTTGGQ5DVYAY","created_at":"2026-07-05T09:14:32.852994+00:00"},{"alias_kind":"pith_short_16","alias_value":"YTTGGQ5DVYAYLPO5","created_at":"2026-07-05T09:14:32.852994+00:00"},{"alias_kind":"pith_short_8","alias_value":"YTTGGQ5D","created_at":"2026-07-05T09:14:32.852994+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":11,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.15079","citing_title":"Ling and Ring 2.6 Technical Report: Efficient and Instant Agentic Intelligence at Trillion-Parameter Scale","ref_index":67,"is_internal_anchor":false},{"citing_arxiv_id":"2606.02981","citing_title":"Predicting Inference-Time Scaling Gains from Labeled Validation-Set Output Statistics","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2606.00047","citing_title":"Comprehensive AI governance requires addressing non-model gains","ref_index":80,"is_internal_anchor":false},{"citing_arxiv_id":"2605.24667","citing_title":"When Mean CE Fails: Median CE Can Better Track Language Model Quality","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2606.07616","citing_title":"Item Response Scaling Laws: A Measurement Theory Approach for Efficient and Generalizable Neural Scaling Estimation","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2506.06414","citing_title":"Benchmarking Misuse Mitigation Against Covert Adversaries","ref_index":47,"is_internal_anchor":false},{"citing_arxiv_id":"2507.23009","citing_title":"Position: Stop Evaluating AI with Human Tests, Develop Principled, AI-specific Tests instead","ref_index":63,"is_internal_anchor":false},{"citing_arxiv_id":"2510.18245","citing_title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2512.11470","citing_title":"Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2510.13786","citing_title":"The Art of Scaling Reinforcement Learning Compute for LLMs","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07096","citing_title":"Query-efficient model evaluation using cached responses","ref_index":135,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/YTTGGQ5DVYAYLPO5Y7DOEKVW2L","json":"https://pith.science/pith/YTTGGQ5DVYAYLPO5Y7DOEKVW2L.json","graph_json":"https://pith.science/api/pith-number/YTTGGQ5DVYAYLPO5Y7DOEKVW2L/graph.json","events_json":"https://pith.science/api/pith-number/YTTGGQ5DVYAYLPO5Y7DOEKVW2L/events.json","paper":"https://pith.science/paper/YTTGGQ5D"},"agent_actions":{"view_html":"https://pith.science/pith/YTTGGQ5DVYAYLPO5Y7DOEKVW2L","download_json":"https://pith.science/pith/YTTGGQ5DVYAYLPO5Y7DOEKVW2L.json","view_paper":"https://pith.science/paper/YTTGGQ5D","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2405.10938&json=true","fetch_graph":"https://pith.science/api/pith-number/YTTGGQ5DVYAYLPO5Y7DOEKVW2L/graph.json","fetch_events":"https://pith.science/api/pith-number/YTTGGQ5DVYAYLPO5Y7DOEKVW2L/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/YTTGGQ5DVYAYLPO5Y7DOEKVW2L/action/timestamp_anchor","attest_storage":"https://pith.science/pith/YTTGGQ5DVYAYLPO5Y7DOEKVW2L/action/storage_attestation","attest_author":"https://pith.science/pith/YTTGGQ5DVYAYLPO5Y7DOEKVW2L/action/author_attestation","sign_citation":"https://pith.science/pith/YTTGGQ5DVYAYLPO5Y7DOEKVW2L/action/citation_signature","submit_replication":"https://pith.science/pith/YTTGGQ5DVYAYLPO5Y7DOEKVW2L/action/replication_record"}},"created_at":"2026-07-05T09:14:32.852994+00:00","updated_at":"2026-07-05T09:14:32.852994+00:00"}