{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:V6S53V4XT3AB777HQJAXQB7IOY","short_pith_number":"pith:V6S53V4X","schema_version":"1.0","canonical_sha256":"afa5ddd7979ec01fffe782417807e8760016ab3c579c293f043be55188bd41f5","source":{"kind":"arxiv","id":"2411.07763","version":2},"attestation_state":"computed","paper":{"title":"Spider 2.0: Evaluating Language Models on Real-World Enterprise Text-to-SQL Workflows","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.DB"],"primary_cat":"cs.CL","authors_text":"Caiming Xiong, Dongchan Shin, Fangyu Lei, Hongcheng Gao, Hongjin Su, Jixuan Chen, Pengcheng Yin, Qian Liu, Ruisheng Cao, Ruoxi Sun, Sida Wang, Tao Yu, Victor Zhong, Wenjing Hu, Yuxiao Ye, Zhaoqing Suo","submitted_at":"2024-11-12T12:52:17Z","abstract_excerpt":"Real-world enterprise text-to-SQL workflows often involve complex cloud or local data across various database systems, multiple SQL queries in various dialects, and diverse operations from data transformation to analytics. We introduce Spider 2.0, an evaluation framework comprising 632 real-world text-to-SQL workflow problems derived from enterprise-level database use cases. The databases in Spider 2.0 are sourced from real data applications, often containing over 1,000 columns and stored in local or cloud database systems such as BigQuery and Snowflake. We show that solving problems in Spider"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2411.07763","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2024-11-12T12:52:17Z","cross_cats_sorted":["cs.AI","cs.DB"],"title_canon_sha256":"54d48cffcc7ea96dcffdebaafb866da672d94a55c59196c426519a588610724b","abstract_canon_sha256":"169dba55d204b9b2165f440ac32f8486952cab82a2d4c1e3607614e58cae46a2"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:32:33.594542Z","signature_b64":"SzQ5AIeq7y1fn/OD7c3KOR4U/fHauL3smph1DjBm8IhOiDxroDEEdlRX6OOYzligoda+bYAPPJuxZbSdpv40AA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"afa5ddd7979ec01fffe782417807e8760016ab3c579c293f043be55188bd41f5","last_reissued_at":"2026-07-05T10:32:33.593581Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:32:33.593581Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Spider 2.0: Evaluating Language Models on Real-World Enterprise Text-to-SQL Workflows","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.DB"],"primary_cat":"cs.CL","authors_text":"Caiming Xiong, Dongchan Shin, Fangyu Lei, Hongcheng Gao, Hongjin Su, Jixuan Chen, Pengcheng Yin, Qian Liu, Ruisheng Cao, Ruoxi Sun, Sida Wang, Tao Yu, Victor Zhong, Wenjing Hu, Yuxiao Ye, Zhaoqing Suo","submitted_at":"2024-11-12T12:52:17Z","abstract_excerpt":"Real-world enterprise text-to-SQL workflows often involve complex cloud or local data across various database systems, multiple SQL queries in various dialects, and diverse operations from data transformation to analytics. We introduce Spider 2.0, an evaluation framework comprising 632 real-world text-to-SQL workflow problems derived from enterprise-level database use cases. The databases in Spider 2.0 are sourced from real data applications, often containing over 1,000 columns and stored in local or cloud database systems such as BigQuery and Snowflake. We show that solving problems in Spider"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2411.07763","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2411.07763/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2411.07763","created_at":"2026-07-05T10:32:33.593723+00:00"},{"alias_kind":"arxiv_version","alias_value":"2411.07763v2","created_at":"2026-07-05T10:32:33.593723+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2411.07763","created_at":"2026-07-05T10:32:33.593723+00:00"},{"alias_kind":"pith_short_12","alias_value":"V6S53V4XT3AB","created_at":"2026-07-05T10:32:33.593723+00:00"},{"alias_kind":"pith_short_16","alias_value":"V6S53V4XT3AB777H","created_at":"2026-07-05T10:32:33.593723+00:00"},{"alias_kind":"pith_short_8","alias_value":"V6S53V4X","created_at":"2026-07-05T10:32:33.593723+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":27,"internal_anchor_count":2,"sample":[{"citing_arxiv_id":"2607.07397","citing_title":"Agentic Data Environments","ref_index":9,"is_internal_anchor":true},{"citing_arxiv_id":"2607.06229","citing_title":"Spider 2.0-AIFunc: Extending Real-World Text-to-SQL to AI-Native SQL Workflows","ref_index":17,"is_internal_anchor":true},{"citing_arxiv_id":"2606.26613","citing_title":"EcoTable: Cost-effective Table Integration in Data Lakes for Natural Language Queries","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2606.26627","citing_title":"Agents That Know Too Much: A Data-Centric Survey of Privacy in LLM Agents","ref_index":60,"is_internal_anchor":false},{"citing_arxiv_id":"2606.11424","citing_title":"SOMA-SQL: Resolving Multi-Source Ambiguity in NL-to-SQL via Synthetic Log and Execution Probing","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2606.03363","citing_title":"EntSQL: A Benchmark for Grounding Text-to-SQL in Long-Context Enterprise Knowledge","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2606.02674","citing_title":"Cross-Vendor Sola ISPM Benchmark: Evaluating Agentic AI for Federated Identity Security Reasoning","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2606.02109","citing_title":"BADGER: Bridging Agentic and Deterministic Evaluation for Generative Enterprise Reasoning","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2606.28601","citing_title":"Database Context Compression for Text-to-SQL on Real-World Large Databases","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2606.23693","citing_title":"EXPO-SQL: Execution-based Clause-level Policy Optimization for Text-to-SQL","ref_index":43,"is_internal_anchor":false},{"citing_arxiv_id":"2605.21792","citing_title":"Residual Skill Optimization for Text-to-SQL Ensembles","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2605.22505","citing_title":"Towards Direct Evaluation of Harness Optimizers via Priority Ranking","ref_index":39,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18768","citing_title":"ClinQueryAgent: A Conversational Agent for Population Health Management","ref_index":181,"is_internal_anchor":false},{"citing_arxiv_id":"2605.02503","citing_title":"DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2605.19010","citing_title":"AgentNLQ: A General-Purpose Agent for Natural Language to SQL","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2602.21480","citing_title":"Both Ends Count! Just How Good are LLM Agents at \"Text-to-Big SQL\"?","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2603.04334","citing_title":"SpotIt+: Verification-based Text-to-SQL Evaluation with Database Constraints","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2604.13048","citing_title":"From Natural Language to PromQL: A Catalog-Driven Framework with Dynamic Temporal Resolution for Cloud-Native Observability","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14259","citing_title":"Hypergraph Enterprise Agentic Reasoner over Heterogeneous Business Systems","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2505.06120","citing_title":"LLMs Get Lost In Multi-Turn Conversation","ref_index":46,"is_internal_anchor":false},{"citing_arxiv_id":"2604.27906","citing_title":"From Unstructured Recall to Schema-Grounded Memory: Reliable AI Memory via Iterative, Schema-Aware Extraction","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09295","citing_title":"LEAF-SQL: Level-wise Exploration with Adaptive Fine-graining for Text-to-SQL Skeleton Prediction","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10516","citing_title":"Consistency as a Testable Property: Statistical Methods to Evaluate AI Agent Reliability","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2605.05525","citing_title":"Anatomy of a Query: W5H Dimensions and FAR Patterns for Text-to-SQL Evaluation","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2604.21414","citing_title":"SemanticAgent: A Semantics-Aware Framework for Text-to-SQL Data Synthesis","ref_index":38,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/V6S53V4XT3AB777HQJAXQB7IOY","json":"https://pith.science/pith/V6S53V4XT3AB777HQJAXQB7IOY.json","graph_json":"https://pith.science/api/pith-number/V6S53V4XT3AB777HQJAXQB7IOY/graph.json","events_json":"https://pith.science/api/pith-number/V6S53V4XT3AB777HQJAXQB7IOY/events.json","paper":"https://pith.science/paper/V6S53V4X"},"agent_actions":{"view_html":"https://pith.science/pith/V6S53V4XT3AB777HQJAXQB7IOY","download_json":"https://pith.science/pith/V6S53V4XT3AB777HQJAXQB7IOY.json","view_paper":"https://pith.science/paper/V6S53V4X","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2411.07763&json=true","fetch_graph":"https://pith.science/api/pith-number/V6S53V4XT3AB777HQJAXQB7IOY/graph.json","fetch_events":"https://pith.science/api/pith-number/V6S53V4XT3AB777HQJAXQB7IOY/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/V6S53V4XT3AB777HQJAXQB7IOY/action/timestamp_anchor","attest_storage":"https://pith.science/pith/V6S53V4XT3AB777HQJAXQB7IOY/action/storage_attestation","attest_author":"https://pith.science/pith/V6S53V4XT3AB777HQJAXQB7IOY/action/author_attestation","sign_citation":"https://pith.science/pith/V6S53V4XT3AB777HQJAXQB7IOY/action/citation_signature","submit_replication":"https://pith.science/pith/V6S53V4XT3AB777HQJAXQB7IOY/action/replication_record"}},"created_at":"2026-07-05T10:32:33.593723+00:00","updated_at":"2026-07-05T10:32:33.593723+00:00"}