{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:5KKMFGDXIPMEP5QRR4ORBF7X6B","short_pith_number":"pith:5KKMFGDX","schema_version":"1.0","canonical_sha256":"ea94c2987743d847f6118f1d1097f7f0479c351bebd550ddf602f399c427468b","source":{"kind":"arxiv","id":"2402.17944","version":4},"attestation_state":"computed","paper":{"title":"Large Language Models(LLMs) on Tabular Data: Prediction, Generation, and Understanding -- A Survey","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Christos Faloutsos, Diego Socolinsky, Fiona Anting Tan, Jiani Zhang, Scott Nickleach, Srinivasan Sengamedu, Weijie Xu, Xi Fang, Yanjun Qi, Ziqing Hu","submitted_at":"2024-02-27T23:59:01Z","abstract_excerpt":"Recent breakthroughs in large language modeling have facilitated rigorous exploration of their application in diverse tasks related to tabular data modeling, such as prediction, tabular data synthesis, question answering, and table understanding. Each task presents unique challenges and opportunities. However, there is currently a lack of comprehensive review that summarizes and compares the key techniques, metrics, datasets, models, and optimization approaches in this research domain. This survey aims to address this gap by consolidating recent progress in these areas, offering a thorough sur"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2402.17944","kind":"arxiv","version":4},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2024-02-27T23:59:01Z","cross_cats_sorted":[],"title_canon_sha256":"657003184e0f80b60feed3464df1ddb4ed1b0b20e33654dbdbcd2b9a15e8515f","abstract_canon_sha256":"dbf9f48612ad51b28478ccaa24364c57e74ceedda99c4d3ef46ac1265e8a94d9"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:35:19.484081Z","signature_b64":"WjDFUtknJdMTzsy7wRvPOuiG4jNJYMv+4CabrKPlRHKUnlTQeSiM7iASFNh2IdTfc3H7CiP6sW5IJ7laL3zqBQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"ea94c2987743d847f6118f1d1097f7f0479c351bebd550ddf602f399c427468b","last_reissued_at":"2026-07-05T08:35:19.483670Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:35:19.483670Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Large Language Models(LLMs) on Tabular Data: Prediction, Generation, and Understanding -- A Survey","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Christos Faloutsos, Diego Socolinsky, Fiona Anting Tan, Jiani Zhang, Scott Nickleach, Srinivasan Sengamedu, Weijie Xu, Xi Fang, Yanjun Qi, Ziqing Hu","submitted_at":"2024-02-27T23:59:01Z","abstract_excerpt":"Recent breakthroughs in large language modeling have facilitated rigorous exploration of their application in diverse tasks related to tabular data modeling, such as prediction, tabular data synthesis, question answering, and table understanding. Each task presents unique challenges and opportunities. However, there is currently a lack of comprehensive review that summarizes and compares the key techniques, metrics, datasets, models, and optimization approaches in this research domain. This survey aims to address this gap by consolidating recent progress in these areas, offering a thorough sur"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2402.17944","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2402.17944/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2402.17944","created_at":"2026-07-05T08:35:19.483726+00:00"},{"alias_kind":"arxiv_version","alias_value":"2402.17944v4","created_at":"2026-07-05T08:35:19.483726+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2402.17944","created_at":"2026-07-05T08:35:19.483726+00:00"},{"alias_kind":"pith_short_12","alias_value":"5KKMFGDXIPME","created_at":"2026-07-05T08:35:19.483726+00:00"},{"alias_kind":"pith_short_16","alias_value":"5KKMFGDXIPMEP5QR","created_at":"2026-07-05T08:35:19.483726+00:00"},{"alias_kind":"pith_short_8","alias_value":"5KKMFGDX","created_at":"2026-07-05T08:35:19.483726+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":8,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.21685","citing_title":"TACO: Task-Aware Column Description Generation Using LLMs","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01890","citing_title":"Segment-driven Structural Induction and Semantic Alignment for Heterogeneous Tabular Representation","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2606.30410","citing_title":"Beyond IID: How General Are Tabular Foundation Models, Really?","ref_index":124,"is_internal_anchor":false},{"citing_arxiv_id":"2501.01785","citing_title":"Can Synthetic Data be Fair and Private? A Comparative Study of Synthetic Data Generation and Fairness Algorithms","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2505.16527","citing_title":"Joint Relational Database Generation via Graph-Conditional Diffusion Models","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2510.09671","citing_title":"Table Question Answering in the Era of Large Language Models: A Comprehensive Survey of Tasks, Methods, and Evaluation","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10865","citing_title":"Beyond Statistical Co-occurrence: Unlocking Intrinsic Semantics for Tabular Data Clustering","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2604.08999","citing_title":"ASTRA: Adaptive Semantic Tree Reasoning Architecture for Complex Table Question Answering","ref_index":1,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/5KKMFGDXIPMEP5QRR4ORBF7X6B","json":"https://pith.science/pith/5KKMFGDXIPMEP5QRR4ORBF7X6B.json","graph_json":"https://pith.science/api/pith-number/5KKMFGDXIPMEP5QRR4ORBF7X6B/graph.json","events_json":"https://pith.science/api/pith-number/5KKMFGDXIPMEP5QRR4ORBF7X6B/events.json","paper":"https://pith.science/paper/5KKMFGDX"},"agent_actions":{"view_html":"https://pith.science/pith/5KKMFGDXIPMEP5QRR4ORBF7X6B","download_json":"https://pith.science/pith/5KKMFGDXIPMEP5QRR4ORBF7X6B.json","view_paper":"https://pith.science/paper/5KKMFGDX","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2402.17944&json=true","fetch_graph":"https://pith.science/api/pith-number/5KKMFGDXIPMEP5QRR4ORBF7X6B/graph.json","fetch_events":"https://pith.science/api/pith-number/5KKMFGDXIPMEP5QRR4ORBF7X6B/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/5KKMFGDXIPMEP5QRR4ORBF7X6B/action/timestamp_anchor","attest_storage":"https://pith.science/pith/5KKMFGDXIPMEP5QRR4ORBF7X6B/action/storage_attestation","attest_author":"https://pith.science/pith/5KKMFGDXIPMEP5QRR4ORBF7X6B/action/author_attestation","sign_citation":"https://pith.science/pith/5KKMFGDXIPMEP5QRR4ORBF7X6B/action/citation_signature","submit_replication":"https://pith.science/pith/5KKMFGDXIPMEP5QRR4ORBF7X6B/action/replication_record"}},"created_at":"2026-07-05T08:35:19.483726+00:00","updated_at":"2026-07-05T08:35:19.483726+00:00"}