{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2022:GVBPPTUSKMMS6V3NI6W64ESNBN","short_pith_number":"pith:GVBPPTUS","schema_version":"1.0","canonical_sha256":"3542f7ce9253192f576d47adee124d0b550d7c8048b628e8440590241a9962f7","source":{"kind":"arxiv","id":"2207.08815","version":1},"attestation_state":"computed","paper":{"title":"Why do tree-based models still outperform deep learning on tabular data?","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","stat.ME","stat.ML"],"primary_cat":"cs.LG","authors_text":"CNRS), Edouard Oyallon (ISIR, Ga\\\"el Varoquaux (SODA), L\\'eo Grinsztajn (SODA)","submitted_at":"2022-07-18T08:36:08Z","abstract_excerpt":"While deep learning has enabled tremendous progress on text and image datasets, its superiority on tabular data is not clear. We contribute extensive benchmarks of standard and novel deep learning methods as well as tree-based models such as XGBoost and Random Forests, across a large number of datasets and hyperparameter combinations. We define a standard set of 45 datasets from varied domains with clear characteristics of tabular data and a benchmarking methodology accounting for both fitting models and finding good hyperparameters. Results show that tree-based models remain state-of-the-art "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2207.08815","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2022-07-18T08:36:08Z","cross_cats_sorted":["cs.AI","stat.ME","stat.ML"],"title_canon_sha256":"ef56744e3b9e53ad6acf7eb210992ad38ad1b7ac5ff95fd5ba21d42512208fe7","abstract_canon_sha256":"4531342407b0c6bd192b2ea78d60d197819f5f95818cca735cc07c68e7623676"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T04:41:13.831654Z","signature_b64":"K9p9K5DZzg+baLko++tSMoIqjZTUyioXPR/dMVFJATivFBE8U5Ofj3/OGgTUdj3w3l6GABUQ/uHzHGacsvKdBw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"3542f7ce9253192f576d47adee124d0b550d7c8048b628e8440590241a9962f7","last_reissued_at":"2026-07-05T04:41:13.831127Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T04:41:13.831127Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Why do tree-based models still outperform deep learning on tabular data?","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","stat.ME","stat.ML"],"primary_cat":"cs.LG","authors_text":"CNRS), Edouard Oyallon (ISIR, Ga\\\"el Varoquaux (SODA), L\\'eo Grinsztajn (SODA)","submitted_at":"2022-07-18T08:36:08Z","abstract_excerpt":"While deep learning has enabled tremendous progress on text and image datasets, its superiority on tabular data is not clear. We contribute extensive benchmarks of standard and novel deep learning methods as well as tree-based models such as XGBoost and Random Forests, across a large number of datasets and hyperparameter combinations. We define a standard set of 45 datasets from varied domains with clear characteristics of tabular data and a benchmarking methodology accounting for both fitting models and finding good hyperparameters. Results show that tree-based models remain state-of-the-art "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2207.08815","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2207.08815/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2207.08815","created_at":"2026-07-05T04:41:13.831178+00:00"},{"alias_kind":"arxiv_version","alias_value":"2207.08815v1","created_at":"2026-07-05T04:41:13.831178+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2207.08815","created_at":"2026-07-05T04:41:13.831178+00:00"},{"alias_kind":"pith_short_12","alias_value":"GVBPPTUSKMMS","created_at":"2026-07-05T04:41:13.831178+00:00"},{"alias_kind":"pith_short_16","alias_value":"GVBPPTUSKMMS6V3N","created_at":"2026-07-05T04:41:13.831178+00:00"},{"alias_kind":"pith_short_8","alias_value":"GVBPPTUS","created_at":"2026-07-05T04:41:13.831178+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":24,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.07158","citing_title":"Weakly supervised machine learning for model-agnostic searches of new phenomena in the $\\gamma$-ray sky","ref_index":30,"is_internal_anchor":true},{"citing_arxiv_id":"2606.26699","citing_title":"Modelling convective cell occurrence in proximity to cold fronts using extreme gradient boosting","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2606.23575","citing_title":"Solve for the Hyperparameter, Skip the Search: Kolmogorov-Optimal Scaling Laws for Spline Regression","ref_index":85,"is_internal_anchor":false},{"citing_arxiv_id":"2606.19827","citing_title":"When, Where, and How: Adaptive Binning for Tabular Self-Supervised Learning","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2606.04485","citing_title":"LimiX-2M: Mitigating Low-Rank Collapse and Attention Bottlenecks in Tabular Foundation Models","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2606.00060","citing_title":"Machine Learning-Based Bitcoin Trading Under Transaction Costs: Evidence From Walk-Forward Forecasting","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2606.19329","citing_title":"The Chandra-Gaia Catalog of Counterparts: Resolving ambiguous Gaia matches to X-ray sources in the Chandra Source Catalog using Machine Learning","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2605.23708","citing_title":"Learning Dynamic Stability Landscapes in Synchronization Networks","ref_index":228,"is_internal_anchor":false},{"citing_arxiv_id":"2301.01864","citing_title":"AXIL: Exact Instance Attribution for Gradient Boosting","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2601.03883","citing_title":"Filtering Interlopers with Photometry and Diagnostic Features: A Machine Learning Framework Validated with CSST Slitless Spectroscopy","ref_index":41,"is_internal_anchor":false},{"citing_arxiv_id":"2502.05564","citing_title":"TabICL: A Tabular Foundation Model for In-Context Learning on Large Data","ref_index":198,"is_internal_anchor":false},{"citing_arxiv_id":"2601.19423","citing_title":"UniRec: Unified Multimodal Encoding for LLM-Based Recommendations","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2207.01848","citing_title":"TabPFN: A Transformer That Solves Small Tabular Classification Problems in a Second","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2604.16378","citing_title":"Reciprocal Co-Training (RCT): Coupling Gradient-Based and Non-Differentiable Models via Reinforcement Learning","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2604.16412","citing_title":"Cooperative Coevolution versus Monolithic Evolutionary Search for Semi-Supervised Tabular Classification","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11091","citing_title":"ASD-Bench: A Four-Axis Comprehensive Benchmark of AI Models for Autism Spectrum Disorder","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2604.25154","citing_title":"Prior-Aligned Data Cleaning for Tabular Foundation Models","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06290","citing_title":"Data Language Models: A New Foundation Model Class for Tabular Data","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2604.22348","citing_title":"A Nationwide Japanese Medical Claims Foundation Model: Balancing Model Scaling and Task-Specific Computational Efficiency","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2604.22096","citing_title":"Who Audits the Auditor? Tamper-Proof Fraud Detection with Blockchain-Anchored Explainable ML","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2604.20965","citing_title":"Kitchen Sink Anomaly Detection","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2604.11394","citing_title":"Optimizing IoT Intrusion Detection with Tabular Foundation Models for Smart City Forensics","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2605.02593","citing_title":"Gradient Boosted Risk Scores","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2605.02693","citing_title":"Random-Effects Algorithm for Random Objects in Metric Spaces","ref_index":21,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/GVBPPTUSKMMS6V3NI6W64ESNBN","json":"https://pith.science/pith/GVBPPTUSKMMS6V3NI6W64ESNBN.json","graph_json":"https://pith.science/api/pith-number/GVBPPTUSKMMS6V3NI6W64ESNBN/graph.json","events_json":"https://pith.science/api/pith-number/GVBPPTUSKMMS6V3NI6W64ESNBN/events.json","paper":"https://pith.science/paper/GVBPPTUS"},"agent_actions":{"view_html":"https://pith.science/pith/GVBPPTUSKMMS6V3NI6W64ESNBN","download_json":"https://pith.science/pith/GVBPPTUSKMMS6V3NI6W64ESNBN.json","view_paper":"https://pith.science/paper/GVBPPTUS","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2207.08815&json=true","fetch_graph":"https://pith.science/api/pith-number/GVBPPTUSKMMS6V3NI6W64ESNBN/graph.json","fetch_events":"https://pith.science/api/pith-number/GVBPPTUSKMMS6V3NI6W64ESNBN/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/GVBPPTUSKMMS6V3NI6W64ESNBN/action/timestamp_anchor","attest_storage":"https://pith.science/pith/GVBPPTUSKMMS6V3NI6W64ESNBN/action/storage_attestation","attest_author":"https://pith.science/pith/GVBPPTUSKMMS6V3NI6W64ESNBN/action/author_attestation","sign_citation":"https://pith.science/pith/GVBPPTUSKMMS6V3NI6W64ESNBN/action/citation_signature","submit_replication":"https://pith.science/pith/GVBPPTUSKMMS6V3NI6W64ESNBN/action/replication_record"}},"created_at":"2026-07-05T04:41:13.831178+00:00","updated_at":"2026-07-05T04:41:13.831178+00:00"}