{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:3WG7IE5VZA3MUJ53FVL6IDR25W","short_pith_number":"pith:3WG7IE5V","schema_version":"1.0","canonical_sha256":"dd8df413b5c836ca27bb2d57e40e3aed990da8e188a4f4537237c625692d8437","source":{"kind":"arxiv","id":"2304.13013","version":2},"attestation_state":"computed","paper":{"title":"Stable and low-precision training for large-scale vision-language models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CV"],"primary_cat":"cs.LG","authors_text":"Ali Farhadi, Ari Morcos, Ludwig Schmidt, Luke Zettlemoyer, Mitchell Wortsman, Tim Dettmers","submitted_at":"2023-04-25T17:38:18Z","abstract_excerpt":"We introduce new methods for 1) accelerating and 2) stabilizing training for large language-vision models. 1) For acceleration, we introduce SwitchBack, a linear layer for int8 quantized training which provides a speed-up of 13-25% while matching the performance of bfloat16 training within 0.1 percentage points for the 1B parameter CLIP ViT-Huge -- the largest int8 training to date. Our main focus is int8 as GPU support for float8 is rare, though we also analyze float8 training through simulation. While SwitchBack proves effective for float8, we show that standard techniques are also successfu"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2304.13013","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2023-04-25T17:38:18Z","cross_cats_sorted":["cs.CV"],"title_canon_sha256":"678eba0c7902afe78948641a84617562144337a541abecc6ff5c134f7c853d46","abstract_canon_sha256":"bda3cc3638a98cb1c22820980049919f83b31511d44e9c7ce019fd18cb29b900"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:01:24.853670Z","signature_b64":"vaAghKEJSv3xDpNwnBAefVGqu0NM7CFPw3RzzxlsP7g/hwSTDBEjefKNr6w7RT/GKZ8C+LBRwIQNCVFwGAz9AQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"dd8df413b5c836ca27bb2d57e40e3aed990da8e188a4f4537237c625692d8437","last_reissued_at":"2026-07-05T07:01:24.853197Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:01:24.853197Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Stable and low-precision training for large-scale vision-language models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CV"],"primary_cat":"cs.LG","authors_text":"Ali Farhadi, Ari Morcos, Ludwig Schmidt, Luke Zettlemoyer, Mitchell Wortsman, Tim Dettmers","submitted_at":"2023-04-25T17:38:18Z","abstract_excerpt":"We introduce new methods for 1) accelerating and 2) stabilizing training for large language-vision models. 1) For acceleration, we introduce SwitchBack, a linear layer for int8 quantized training which provides a speed-up of 13-25% while matching the performance of bfloat16 training within 0.1 percentage points for the 1B parameter CLIP ViT-Huge -- the largest int8 training to date. Our main focus is int8 as GPU support for float8 is rare, though we also analyze float8 training through simulation. While SwitchBack proves effective for float8, we show that standard techniques are also successfu"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2304.13013","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2304.13013/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2304.13013","created_at":"2026-07-05T07:01:24.853255+00:00"},{"alias_kind":"arxiv_version","alias_value":"2304.13013v2","created_at":"2026-07-05T07:01:24.853255+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2304.13013","created_at":"2026-07-05T07:01:24.853255+00:00"},{"alias_kind":"pith_short_12","alias_value":"3WG7IE5VZA3M","created_at":"2026-07-05T07:01:24.853255+00:00"},{"alias_kind":"pith_short_16","alias_value":"3WG7IE5VZA3MUJ53","created_at":"2026-07-05T07:01:24.853255+00:00"},{"alias_kind":"pith_short_8","alias_value":"3WG7IE5V","created_at":"2026-07-05T07:01:24.853255+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":3,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.01904","citing_title":"KliniskVestBERT: BERT Model Specialised to Norwegian Clinical Texts","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2412.13663","citing_title":"Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference","ref_index":200,"is_internal_anchor":false},{"citing_arxiv_id":"2305.14314","citing_title":"QLoRA: Efficient Finetuning of Quantized LLMs","ref_index":65,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/3WG7IE5VZA3MUJ53FVL6IDR25W","json":"https://pith.science/pith/3WG7IE5VZA3MUJ53FVL6IDR25W.json","graph_json":"https://pith.science/api/pith-number/3WG7IE5VZA3MUJ53FVL6IDR25W/graph.json","events_json":"https://pith.science/api/pith-number/3WG7IE5VZA3MUJ53FVL6IDR25W/events.json","paper":"https://pith.science/paper/3WG7IE5V"},"agent_actions":{"view_html":"https://pith.science/pith/3WG7IE5VZA3MUJ53FVL6IDR25W","download_json":"https://pith.science/pith/3WG7IE5VZA3MUJ53FVL6IDR25W.json","view_paper":"https://pith.science/paper/3WG7IE5V","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2304.13013&json=true","fetch_graph":"https://pith.science/api/pith-number/3WG7IE5VZA3MUJ53FVL6IDR25W/graph.json","fetch_events":"https://pith.science/api/pith-number/3WG7IE5VZA3MUJ53FVL6IDR25W/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/3WG7IE5VZA3MUJ53FVL6IDR25W/action/timestamp_anchor","attest_storage":"https://pith.science/pith/3WG7IE5VZA3MUJ53FVL6IDR25W/action/storage_attestation","attest_author":"https://pith.science/pith/3WG7IE5VZA3MUJ53FVL6IDR25W/action/author_attestation","sign_citation":"https://pith.science/pith/3WG7IE5VZA3MUJ53FVL6IDR25W/action/citation_signature","submit_replication":"https://pith.science/pith/3WG7IE5VZA3MUJ53FVL6IDR25W/action/replication_record"}},"created_at":"2026-07-05T07:01:24.853255+00:00","updated_at":"2026-07-05T07:01:24.853255+00:00"}