{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:23NNQ6EODBKEEREPDJE2XVOLVW","short_pith_number":"pith:23NNQ6EO","schema_version":"1.0","canonical_sha256":"d6dad8788e185442448f1a49abd5cbadb7d2eb922f040bf07ed2610b6fb97d4e","source":{"kind":"arxiv","id":"2410.12189","version":3},"attestation_state":"computed","paper":{"title":"DocETL: Agentic Query Rewriting and Evaluation for Complex Document Processing","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.DB","authors_text":"Aditya G. Parameswaran, Eugene Wu, Shreya Shankar, Tarak Shah, Tristan Chambers","submitted_at":"2024-10-16T03:22:35Z","abstract_excerpt":"Analyzing unstructured data has been a persistent challenge in data processing. Large Language Models (LLMs) have shown promise in this regard, leading to recent proposals for declarative frameworks for LLM-powered processing of unstructured data. However, these frameworks focus on reducing cost when executing user-specified operations using LLMs, rather than improving accuracy, executing most operations as-is (in a single LLM call). This is problematic for complex tasks and data, where LLM outputs for user-defined operations are often inaccurate, even with optimized prompts. For example, an L"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2410.12189","kind":"arxiv","version":3},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.DB","submitted_at":"2024-10-16T03:22:35Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"78a04a2fe22b6facadb6f3143e6ae0ba676b2118f8ddc6c9bfb6da7e347f0bd4","abstract_canon_sha256":"ca26eec14157c174ff7f9c3d4ec712e27dd820e9f8bdc9219d268fb27c370245"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:43:02.387254Z","signature_b64":"aKO3Sz15x3RvINgDLuInOwDBEub1k7KvYm6hAk5JC0wLgRS+tk6f7RKtrLM1fBaIwxa3KM8fT1RN00Ep4TQMCw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"d6dad8788e185442448f1a49abd5cbadb7d2eb922f040bf07ed2610b6fb97d4e","last_reissued_at":"2026-07-05T10:43:02.386819Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:43:02.386819Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"DocETL: Agentic Query Rewriting and Evaluation for Complex Document Processing","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.DB","authors_text":"Aditya G. Parameswaran, Eugene Wu, Shreya Shankar, Tarak Shah, Tristan Chambers","submitted_at":"2024-10-16T03:22:35Z","abstract_excerpt":"Analyzing unstructured data has been a persistent challenge in data processing. Large Language Models (LLMs) have shown promise in this regard, leading to recent proposals for declarative frameworks for LLM-powered processing of unstructured data. However, these frameworks focus on reducing cost when executing user-specified operations using LLMs, rather than improving accuracy, executing most operations as-is (in a single LLM call). This is problematic for complex tasks and data, where LLM outputs for user-defined operations are often inaccurate, even with optimized prompts. For example, an L"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2410.12189","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2410.12189/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2410.12189","created_at":"2026-07-05T10:43:02.386870+00:00"},{"alias_kind":"arxiv_version","alias_value":"2410.12189v3","created_at":"2026-07-05T10:43:02.386870+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2410.12189","created_at":"2026-07-05T10:43:02.386870+00:00"},{"alias_kind":"pith_short_12","alias_value":"23NNQ6EODBKE","created_at":"2026-07-05T10:43:02.386870+00:00"},{"alias_kind":"pith_short_16","alias_value":"23NNQ6EODBKEEREP","created_at":"2026-07-05T10:43:02.386870+00:00"},{"alias_kind":"pith_short_8","alias_value":"23NNQ6EO","created_at":"2026-07-05T10:43:02.386870+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":20,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.08177","citing_title":"ASMR: Agentic Schema Generation for Ship Maintenance Report Writing","ref_index":16,"is_internal_anchor":true},{"citing_arxiv_id":"2606.21831","citing_title":"RAIDS: Rethinking Data Systems as Responsible Intelligent Infrastructure","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2607.01468","citing_title":"CADENZA in Action: Breaking the Monolith with Intent-Dependent Plan Spaces for Semantic Queries","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2606.08090","citing_title":"Fast LLM-Based Semantic Filtering: From a Unified Framework to an Adaptive Two-Phase Method","ref_index":39,"is_internal_anchor":false},{"citing_arxiv_id":"2606.07923","citing_title":"Larch: Learned Query Optimization for Semantic Predicates","ref_index":56,"is_internal_anchor":false},{"citing_arxiv_id":"2606.02282","citing_title":"POIROT: Interrogating Agents for Failure Detection in Multi-Agent Systems","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2606.28365","citing_title":"CAMI: Cost-Aware Agent-Guided Multi-Indexing for Semantic Retrieval","ref_index":43,"is_internal_anchor":false},{"citing_arxiv_id":"2606.29532","citing_title":"SemJoin: Semantic Join Optimization","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2509.12610","citing_title":"ScaleDoc: Scaling LLM-based Predicates over Large Document Collections","ref_index":39,"is_internal_anchor":false},{"citing_arxiv_id":"2509.00303","citing_title":"Access Paths for Efficient Ordering with Large Language Models","ref_index":59,"is_internal_anchor":false},{"citing_arxiv_id":"2508.05012","citing_title":"Making Prompts First-Class Citizens for Adaptive LLM Pipelines","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2601.16432","citing_title":"iPDB -- Optimizing Semantic SQL Queries","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2603.15970","citing_title":"100x Cost & Latency Reduction: Performance Analysis of AI Query Approximation using Lightweight Proxy Models","ref_index":43,"is_internal_anchor":false},{"citing_arxiv_id":"2604.02690","citing_title":"AnnoRetrieve: Efficient Structured Retrieval for Unstructured Document Analysis","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2604.02655","citing_title":"Semantic Data Processing with Holistic Data Understanding","ref_index":55,"is_internal_anchor":false},{"citing_arxiv_id":"2604.09944","citing_title":"PLOP: Cost-Based Placement of Semantic Operators in Hybrid Query Plans","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2604.04479","citing_title":"How can LLMs Support Policy Researchers? Evaluating an LLM-Assisted Workflow for Large-Scale Unstructured Data","ref_index":56,"is_internal_anchor":false},{"citing_arxiv_id":"2604.17815","citing_title":"Navigating the Conceptual Multiverse","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2604.15233","citing_title":"Blue Data Intelligence Layer: Streaming Data and Agents for Multi-source Multi-modal Data-Centric Applications","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2604.21765","citing_title":"PrismaDV: Automated Task-Aware Data Unit Test Generation","ref_index":67,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/23NNQ6EODBKEEREPDJE2XVOLVW","json":"https://pith.science/pith/23NNQ6EODBKEEREPDJE2XVOLVW.json","graph_json":"https://pith.science/api/pith-number/23NNQ6EODBKEEREPDJE2XVOLVW/graph.json","events_json":"https://pith.science/api/pith-number/23NNQ6EODBKEEREPDJE2XVOLVW/events.json","paper":"https://pith.science/paper/23NNQ6EO"},"agent_actions":{"view_html":"https://pith.science/pith/23NNQ6EODBKEEREPDJE2XVOLVW","download_json":"https://pith.science/pith/23NNQ6EODBKEEREPDJE2XVOLVW.json","view_paper":"https://pith.science/paper/23NNQ6EO","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2410.12189&json=true","fetch_graph":"https://pith.science/api/pith-number/23NNQ6EODBKEEREPDJE2XVOLVW/graph.json","fetch_events":"https://pith.science/api/pith-number/23NNQ6EODBKEEREPDJE2XVOLVW/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/23NNQ6EODBKEEREPDJE2XVOLVW/action/timestamp_anchor","attest_storage":"https://pith.science/pith/23NNQ6EODBKEEREPDJE2XVOLVW/action/storage_attestation","attest_author":"https://pith.science/pith/23NNQ6EODBKEEREPDJE2XVOLVW/action/author_attestation","sign_citation":"https://pith.science/pith/23NNQ6EODBKEEREPDJE2XVOLVW/action/citation_signature","submit_replication":"https://pith.science/pith/23NNQ6EODBKEEREPDJE2XVOLVW/action/replication_record"}},"created_at":"2026-07-05T10:43:02.386870+00:00","updated_at":"2026-07-05T10:43:02.386870+00:00"}