{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:UJAICKRPBMMFRBDCKOVJ6PVDNW","short_pith_number":"pith:UJAICKRP","schema_version":"1.0","canonical_sha256":"a240812a2f0b1858846253aa9f3ea36db7ba1b6ec3f648d36b217e50301cf6a9","source":{"kind":"arxiv","id":"2304.14108","version":5},"attestation_state":"computed","paper":{"title":"DataComp: In search of the next generation of multimodal datasets","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL","cs.LG"],"primary_cat":"cs.CV","authors_text":"Alexander Ratner, Alex Dimakis, Alex Fang, Ali Farhadi, Dhruba Ghosh, Eyal Orgad, Gabriel Ilharco, Georgios Smyrnis, Giannis Daras, Hannaneh Hajishirzi, Jenia Jitsev, Jieyu Zhang, Jonathan Hayase, Kalyani Marathe, Ludwig Schmidt, Mehdi Cherti, Mitchell Wortsman, Olga Saukh, Pang Wei Koh, Rahim Entezari, Ranjay Krishna, Richard Vencu, Romain Beaumont, Ryan Marten, Samir Yitzhak Gadre, Sarah Pratt, Sewoong Oh, Shuran Song, Stephen Mussmann, Thao Nguyen, Vaishaal Shankar, Vivek Ramanujan, Yair Carmon, Yonatan Bitton","submitted_at":"2023-04-27T11:37:18Z","abstract_excerpt":"Multimodal datasets are a critical component in recent breakthroughs such as Stable Diffusion and GPT-4, yet their design does not receive the same research attention as model architectures or training algorithms. To address this shortcoming in the ML ecosystem, we introduce DataComp, a testbed for dataset experiments centered around a new candidate pool of 12.8 billion image-text pairs from Common Crawl. Participants in our benchmark design new filtering techniques or curate new data sources and then evaluate their new dataset by running our standardized CLIP training code and testing the res"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2304.14108","kind":"arxiv","version":5},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2023-04-27T11:37:18Z","cross_cats_sorted":["cs.CL","cs.LG"],"title_canon_sha256":"2c8c482ae4d53fb18c4964d459993dac1ccec497a052df01f536a1029aa6bb00","abstract_canon_sha256":"25f261d185a33dd5947f1e8d2550fb79f1877531e49cc16153a24e6aa8002e67"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:03:10.064774Z","signature_b64":"oMqNYsCKBQFXytnNRrP+kZfUhrwR/XbBEsDE69OyJ9auZoWJjZ1y8403U6FxO/V8eBmt099amYU/5OtAlb17DA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"a240812a2f0b1858846253aa9f3ea36db7ba1b6ec3f648d36b217e50301cf6a9","last_reissued_at":"2026-07-05T07:03:10.064273Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:03:10.064273Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"DataComp: In search of the next generation of multimodal datasets","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL","cs.LG"],"primary_cat":"cs.CV","authors_text":"Alexander Ratner, Alex Dimakis, Alex Fang, Ali Farhadi, Dhruba Ghosh, Eyal Orgad, Gabriel Ilharco, Georgios Smyrnis, Giannis Daras, Hannaneh Hajishirzi, Jenia Jitsev, Jieyu Zhang, Jonathan Hayase, Kalyani Marathe, Ludwig Schmidt, Mehdi Cherti, Mitchell Wortsman, Olga Saukh, Pang Wei Koh, Rahim Entezari, Ranjay Krishna, Richard Vencu, Romain Beaumont, Ryan Marten, Samir Yitzhak Gadre, Sarah Pratt, Sewoong Oh, Shuran Song, Stephen Mussmann, Thao Nguyen, Vaishaal Shankar, Vivek Ramanujan, Yair Carmon, Yonatan Bitton","submitted_at":"2023-04-27T11:37:18Z","abstract_excerpt":"Multimodal datasets are a critical component in recent breakthroughs such as Stable Diffusion and GPT-4, yet their design does not receive the same research attention as model architectures or training algorithms. To address this shortcoming in the ML ecosystem, we introduce DataComp, a testbed for dataset experiments centered around a new candidate pool of 12.8 billion image-text pairs from Common Crawl. Participants in our benchmark design new filtering techniques or curate new data sources and then evaluate their new dataset by running our standardized CLIP training code and testing the res"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2304.14108","kind":"arxiv","version":5},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2304.14108/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2304.14108","created_at":"2026-07-05T07:03:10.064331+00:00"},{"alias_kind":"arxiv_version","alias_value":"2304.14108v5","created_at":"2026-07-05T07:03:10.064331+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2304.14108","created_at":"2026-07-05T07:03:10.064331+00:00"},{"alias_kind":"pith_short_12","alias_value":"UJAICKRPBMMF","created_at":"2026-07-05T07:03:10.064331+00:00"},{"alias_kind":"pith_short_16","alias_value":"UJAICKRPBMMFRBDC","created_at":"2026-07-05T07:03:10.064331+00:00"},{"alias_kind":"pith_short_8","alias_value":"UJAICKRP","created_at":"2026-07-05T07:03:10.064331+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":25,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.24253","citing_title":"TuringViT: Making SOTA Vision Transformers Accessible to All","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2606.26199","citing_title":"MIRAGE: Protecting against Malicious Image Editing via False Moderation","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2606.17030","citing_title":"Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation","ref_index":59,"is_internal_anchor":false},{"citing_arxiv_id":"2606.06624","citing_title":"Principles and Practice of Deep Representation Learning: or a Mathematical Theory of Memory","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20278","citing_title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2606.26199","citing_title":"MIRAGE: Protecting against Malicious Image Editing via False Moderation","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2606.24253","citing_title":"TuringViT: Making SOTA Vision Transformers Accessible to All","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2605.30341","citing_title":"GPIC: A Giant Permissive Image Corpus for Visual Generation","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2606.07865","citing_title":"Instrumented data for causal scientific machine learning","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2504.09925","citing_title":"FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2505.23747","citing_title":"Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20278","citing_title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2408.04840","citing_title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","ref_index":211,"is_internal_anchor":false},{"citing_arxiv_id":"2510.04056","citing_title":"QuiLL: An LLM-Based Vulnerability Assessment Framework for the Wild","ref_index":50,"is_internal_anchor":false},{"citing_arxiv_id":"2311.04257","citing_title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2406.11794","citing_title":"DataComp-LM: In search of the next generation of training sets for language models","ref_index":66,"is_internal_anchor":false},{"citing_arxiv_id":"2307.05663","citing_title":"Objaverse-XL: A Universe of 10M+ 3D Objects","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2505.23747","citing_title":"Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2307.06942","citing_title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","ref_index":71,"is_internal_anchor":false},{"citing_arxiv_id":"2308.01390","citing_title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2604.14198","citing_title":"MixAtlas: Uncertainty-aware Data Mixture Optimization for Multimodal LLM Midtraining","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2311.12793","citing_title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09433","citing_title":"Offline Preference Optimization for Rectified Flow with Noise-Tracked Pairs","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2604.25154","citing_title":"Prior-Aligned Data Cleaning for Tabular Foundation Models","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2605.05416","citing_title":"From Cradle to Cloud: A Life Cycle Review of AI's Environmental Footprint","ref_index":38,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/UJAICKRPBMMFRBDCKOVJ6PVDNW","json":"https://pith.science/pith/UJAICKRPBMMFRBDCKOVJ6PVDNW.json","graph_json":"https://pith.science/api/pith-number/UJAICKRPBMMFRBDCKOVJ6PVDNW/graph.json","events_json":"https://pith.science/api/pith-number/UJAICKRPBMMFRBDCKOVJ6PVDNW/events.json","paper":"https://pith.science/paper/UJAICKRP"},"agent_actions":{"view_html":"https://pith.science/pith/UJAICKRPBMMFRBDCKOVJ6PVDNW","download_json":"https://pith.science/pith/UJAICKRPBMMFRBDCKOVJ6PVDNW.json","view_paper":"https://pith.science/paper/UJAICKRP","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2304.14108&json=true","fetch_graph":"https://pith.science/api/pith-number/UJAICKRPBMMFRBDCKOVJ6PVDNW/graph.json","fetch_events":"https://pith.science/api/pith-number/UJAICKRPBMMFRBDCKOVJ6PVDNW/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/UJAICKRPBMMFRBDCKOVJ6PVDNW/action/timestamp_anchor","attest_storage":"https://pith.science/pith/UJAICKRPBMMFRBDCKOVJ6PVDNW/action/storage_attestation","attest_author":"https://pith.science/pith/UJAICKRPBMMFRBDCKOVJ6PVDNW/action/author_attestation","sign_citation":"https://pith.science/pith/UJAICKRPBMMFRBDCKOVJ6PVDNW/action/citation_signature","submit_replication":"https://pith.science/pith/UJAICKRPBMMFRBDCKOVJ6PVDNW/action/replication_record"}},"created_at":"2026-07-05T07:03:10.064331+00:00","updated_at":"2026-07-05T07:03:10.064331+00:00"}