{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2020:H7FPZAJX5XV6WZXMXVXCFTKHGS","short_pith_number":"pith:H7FPZAJX","schema_version":"1.0","canonical_sha256":"3fcafc8137edebeb66ecbd6e22cd473486ea126b709222d5585faa33bbc97beb","source":{"kind":"arxiv","id":"2003.09758","version":1},"attestation_state":"computed","paper":{"title":"ARDA: Automatic Relational Data Augmentation for Machine Learning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.DB","stat.ML"],"primary_cat":"cs.LG","authors_text":"David Karger, Emanuel Zgraggen, Nadiia Chepurko, Raul Castro Fernandez, Ryan Marcus, Tim Kraska","submitted_at":"2020-03-21T21:55:22Z","abstract_excerpt":"Automatic machine learning (\\AML) is a family of techniques to automate the process of training predictive models, aiming to both improve performance and make machine learning more accessible. While many recent works have focused on aspects of the machine learning pipeline like model selection, hyperparameter tuning, and feature selection, relatively few works have focused on automatic data augmentation. Automatic data augmentation involves finding new features relevant to the user's predictive task with minimal ``human-in-the-loop'' involvement.\n  We present \\system, an end-to-end system that"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2003.09758","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2020-03-21T21:55:22Z","cross_cats_sorted":["cs.DB","stat.ML"],"title_canon_sha256":"b1b28d1c8fc07ae120a711fa67dfe38aa5a8ec7113799919ca1fe0bc301fc122","abstract_canon_sha256":"a77e142caea7b2685da3548be12c1dd1f6510251414a95a733033e9c5ebea1ae"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T00:49:46.784145Z","signature_b64":"rAaoPPxrbjOQtjceDMxWCQNbRQC5oadSAuvQMNGJnfqjcBivZkRz5Mb0Gt5J84GqE2Ng/hJ3m60Ebccg1PdtDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"3fcafc8137edebeb66ecbd6e22cd473486ea126b709222d5585faa33bbc97beb","last_reissued_at":"2026-07-05T00:49:46.783764Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T00:49:46.783764Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"ARDA: Automatic Relational Data Augmentation for Machine Learning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.DB","stat.ML"],"primary_cat":"cs.LG","authors_text":"David Karger, Emanuel Zgraggen, Nadiia Chepurko, Raul Castro Fernandez, Ryan Marcus, Tim Kraska","submitted_at":"2020-03-21T21:55:22Z","abstract_excerpt":"Automatic machine learning (\\AML) is a family of techniques to automate the process of training predictive models, aiming to both improve performance and make machine learning more accessible. While many recent works have focused on aspects of the machine learning pipeline like model selection, hyperparameter tuning, and feature selection, relatively few works have focused on automatic data augmentation. Automatic data augmentation involves finding new features relevant to the user's predictive task with minimal ``human-in-the-loop'' involvement.\n  We present \\system, an end-to-end system that"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2003.09758","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2003.09758/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2003.09758","created_at":"2026-07-05T00:49:46.783826+00:00"},{"alias_kind":"arxiv_version","alias_value":"2003.09758v1","created_at":"2026-07-05T00:49:46.783826+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2003.09758","created_at":"2026-07-05T00:49:46.783826+00:00"},{"alias_kind":"pith_short_12","alias_value":"H7FPZAJX5XV6","created_at":"2026-07-05T00:49:46.783826+00:00"},{"alias_kind":"pith_short_16","alias_value":"H7FPZAJX5XV6WZXM","created_at":"2026-07-05T00:49:46.783826+00:00"},{"alias_kind":"pith_short_8","alias_value":"H7FPZAJX","created_at":"2026-07-05T00:49:46.783826+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2508.20986","citing_title":"Graph-Based Feature Augmentation for Predictive Tasks on Relational Datasets","ref_index":11,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/H7FPZAJX5XV6WZXMXVXCFTKHGS","json":"https://pith.science/pith/H7FPZAJX5XV6WZXMXVXCFTKHGS.json","graph_json":"https://pith.science/api/pith-number/H7FPZAJX5XV6WZXMXVXCFTKHGS/graph.json","events_json":"https://pith.science/api/pith-number/H7FPZAJX5XV6WZXMXVXCFTKHGS/events.json","paper":"https://pith.science/paper/H7FPZAJX"},"agent_actions":{"view_html":"https://pith.science/pith/H7FPZAJX5XV6WZXMXVXCFTKHGS","download_json":"https://pith.science/pith/H7FPZAJX5XV6WZXMXVXCFTKHGS.json","view_paper":"https://pith.science/paper/H7FPZAJX","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2003.09758&json=true","fetch_graph":"https://pith.science/api/pith-number/H7FPZAJX5XV6WZXMXVXCFTKHGS/graph.json","fetch_events":"https://pith.science/api/pith-number/H7FPZAJX5XV6WZXMXVXCFTKHGS/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/H7FPZAJX5XV6WZXMXVXCFTKHGS/action/timestamp_anchor","attest_storage":"https://pith.science/pith/H7FPZAJX5XV6WZXMXVXCFTKHGS/action/storage_attestation","attest_author":"https://pith.science/pith/H7FPZAJX5XV6WZXMXVXCFTKHGS/action/author_attestation","sign_citation":"https://pith.science/pith/H7FPZAJX5XV6WZXMXVXCFTKHGS/action/citation_signature","submit_replication":"https://pith.science/pith/H7FPZAJX5XV6WZXMXVXCFTKHGS/action/replication_record"}},"created_at":"2026-07-05T00:49:46.783826+00:00","updated_at":"2026-07-05T00:49:46.783826+00:00"}