{"as_of":"2026-08-08T20:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:347b9cf36a9135398d2574f30c2068a3f1096c9cc923a4244c2e36087fe589a3","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T02:02:26.410742Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.00018/citation-record","integrity":"/paper/2608.00018/integrity","json":"/paper/2608.00018/citation-record.json","paper":"/paper/2608.00018"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2012.15330","last_updated":"2020-12-30T21:29:48Z","snapshot_observed_at":"2026-07-06T10:28:50.574910Z","submitted_at":"2020-12-30T21:29:48Z","title":"Sequential Deep Learning for Credit Risk Monitoring with Tabular Financial Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.15330","snapshot_observed_at":"2026-08-04T02:02:23.763275Z","title":"Sequential deep learning for credit risk monitoring with tabular financial data,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:23.763275Z"},"links":{"cited_paper":"/paper/2012.15330","citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:825d0daa6808ce4661fec81f9274264fdda7dff74d2dad03f9ea1fb4043b375a","observation_id":"bd756d7b-4393-4742-9042-02070270ad44","resolution":{"observed_at":"2026-08-04T02:02:23.763275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:23.812314Z","title":"Trust issues: Uncertainty estima- tion does not enable reliable ood detection on medical tabular data,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:23.812314Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:756c6f2b7c33fb6804adb9e5af0968f1a53d3f51f82fd0ce9a04c4b33566b1be","observation_id":"714680ab-e06d-4dd5-953b-13d504c018a5","resolution":{"observed_at":"2026-08-04T02:02:23.812314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:23.874660Z","title":"Benchmarking spreadsheet systems,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:23.874660Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:ba7e6f041463bf6a93b56e1a97911b1837c3d37c35ed7c719bd9da4779d4c573","observation_id":"b0cacf37-073f-4346-8669-81bbe4a39a60","resolution":{"observed_at":"2026-08-04T02:02:23.874660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:23.900548Z","title":"Overview and importance of data quality for machine learning tasks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:23.900548Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:d864a6ff3f6e97569eb9965957acdbcf20fd5a10007c44b1b7dbf347529e71b5","observation_id":"123742d9-9a22-4dfe-8d98-6489ff95d4f3","resolution":{"observed_at":"2026-08-04T02:02:23.900548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:23.942421Z","title":"Data mining preparation: process, techniques and major issues in data analysis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:23.942421Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:9d9933339b1f037f55795b227e45d548103135062f1ca3a86bf5d5bb8c5c8519","observation_id":"5a861eaa-1ccb-4263-9630-a282b86f82f9","resolution":{"observed_at":"2026-08-04T02:02:23.942421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:23.990689Z","title":"Large language model for table processing: A survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:23.990689Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:bfd7b54a97cb0b7654b738c471c67d51930dc117360546ca37a4c493167b60f5","observation_id":"e3d360b8-db55-4bb4-90ac-a4707b96e2f6","resolution":{"observed_at":"2026-08-04T02:02:23.990689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01678","last_updated":"2024-10-28T22:24:01Z","snapshot_observed_at":"2026-07-06T16:56:25.554848Z","submitted_at":"2023-12-04T07:01:54Z","title":"Jellyfish: A Large Language Model for Data Preprocessing","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01678","snapshot_observed_at":"2026-08-04T02:02:24.031857Z","title":"Jellyfish: A large lan- guage model for data preprocessing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.031857Z"},"links":{"cited_paper":"/paper/2312.01678","citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:2699f0f768c5bd24264881fe2e59480b7e62f0e637f05b6a08deb29fb274bb43","observation_id":"b2bbd933-6bc9-479b-a7ee-4c9aaee98964","resolution":{"observed_at":"2026-08-04T02:02:24.031857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:24.058617Z","title":"Table-llm-specialist: Language model specialists for tables using iter- ative fine-tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.058617Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:f135822afb8b16dd86ef82d9495ca714302588a32033c9285636c45c5081fd00","observation_id":"e772b09b-bfd6-4fbd-b1b8-2825e17bac9a","resolution":{"observed_at":"2026-08-04T02:02:24.058617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:24.098296Z","title":"Iterclean: An iterative data cleaning framework with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.098296Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:1b7bd954f31814e4b5efab201054b3b31f3fa3522f8412c6e7245fa1ab2396a3","observation_id":"c0b3f172-ac50-4146-a831-40cedc4b3a6b","resolution":{"observed_at":"2026-08-04T02:02:24.098296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:24.155269Z","title":"Cocoon: Semantic table profiling using large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.155269Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:71fb8364e8eb55efcd88635a99cfa99c2a430b22084ba44585166b2ccbd61e36","observation_id":"5a659b93-ef57-4fb8-95d7-76242b6a9d2a","resolution":{"observed_at":"2026-08-04T02:02:24.155269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:24.195429Z","title":"Retclean: Retrieval-based data cleaning using llms and data lakes,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.195429Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:22bf90236d3a0c634550377014c8ed3ba3a2da120216da69002538643a7e9db8","observation_id":"bfd7102d-479e-4d89-b6d8-519c7e4f4a30","resolution":{"observed_at":"2026-08-04T02:02:24.195429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:24.237831Z","title":"A zero-training error correction system with large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.237831Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:9e89704c11b4172d1d15200c9072e9f9149154282ce3768bf5c6ae7d1b4fe598","observation_id":"172bb5eb-dcfa-4ebd-8696-354adb151384","resolution":{"observed_at":"2026-08-04T02:02:24.237831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:24.268320Z","title":"Tap4llm: Table provider on sampling, augmenting, and packing semi-structured data for large language model reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.268320Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:38ee638f74fabd5fc20603c8cb689387e0bc8ecad67cae4ea77a6f4f9d844e84","observation_id":"81a38ad0-ff84-42b4-a8c4-0afb7fe5501e","resolution":{"observed_at":"2026-08-04T02:02:24.268320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:24.299457Z","title":"Table-gpt: Table fine-tuned gpt for diverse table tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.299457Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:e101b32d3786aecb7f0ce0cb8ab362259a077f0a8586f567ab29d03ec63ad876","observation_id":"0db0ab6b-0dd7-4ef1-9e8e-f0283ff3e56a","resolution":{"observed_at":"2026-08-04T02:02:24.299457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:24.339800Z","title":"Tablellm: Enabling tabular data manipulation by llms in real office usage scenarios,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.339800Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:bd24ec53b94ec2163923baba0a933d96bd7022ec09412c37308160448b49ac53","observation_id":"d610d362-ddbd-45fb-bbfa-37ac360a2ea6","resolution":{"observed_at":"2026-08-04T02:02:24.339800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:24.382245Z","title":"Unidm: A unified framework for data manipulation with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.382245Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:97a43a699352d13b1c1c43c322f9f4aed06cef7b1a19ca4ac9ee62ec4ea38aa7","observation_id":"174f2187-5b2c-4969-b7c2-09c532e4c452","resolution":{"observed_at":"2026-08-04T02:02:24.382245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12063","last_updated":"2024-06-01T07:35:26Z","snapshot_observed_at":"2026-07-06T18:16:46.770981Z","submitted_at":"2024-05-20T14:34:01Z","title":"CLAMBER: A Benchmark of Identifying and Clarifying Ambiguous Information Needs in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12063","snapshot_observed_at":"2026-08-04T02:02:24.456316Z","title":"Clamber: A benchmark of identifying and clarifying ambiguous information needs in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.456316Z"},"links":{"cited_paper":"/paper/2405.12063","citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:9cf313566155a6975c5e98f599f92920bd28a1052f446f723def89ccf9b6729a","observation_id":"f602e49b-25a1-4ada-aa7c-b311a32adbdc","resolution":{"observed_at":"2026-08-04T02:02:24.456316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01633","last_updated":"2024-06-01T15:54:45Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-01T15:54:45Z","title":"On Overcoming Miscalibrated Conversational Priors in LLM-based Chatbots","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01633","snapshot_observed_at":"2026-08-04T02:02:24.496620Z","title":"On over- coming miscalibrated conversational priors in llm-based chatbots,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.496620Z"},"links":{"cited_paper":"/paper/2406.01633","citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:9f71b5b5685364083bfadf6ee16883d982bd21c6bd0e389e5c0f9090c58769de","observation_id":"1e1b6631-4eb7-4f92-88e6-9508b962dc98","resolution":{"observed_at":"2026-08-04T02:02:24.496620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:24.523316Z","title":"Why johnny can’t prompt: how non-ai experts try (and fail) to design llm prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.523316Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:4503a936d69d6db8b56f908f07660d44c8b09ac72dcd8ea48873a2cfaf55a7ed","observation_id":"4d362a67-2658-4acf-8c00-ff0279205e1e","resolution":{"observed_at":"2026-08-04T02:02:24.523316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:24.560033Z","title":"Evaluating text-to-sql model failures on real-world data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.560033Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:ebe653793136e88c8c039f04d112bfb9747dc5cd1b014e6140a34961e38bcca1","observation_id":"344a4603-1f1b-446f-88c9-b2ff59c1fb1e","resolution":{"observed_at":"2026-08-04T02:02:24.560033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:24.594794Z","title":"Spreadsheetbench: Towards challenging real world spreadsheet manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.594794Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:b9765d875dc0236df35b44e04e33fed96261e7455b42eb447baa40719585aa3b","observation_id":"654c0c27-14ae-419f-a276-768da14d244b","resolution":{"observed_at":"2026-08-04T02:02:24.594794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:24.630830Z","title":"Sheetagent: towards a generalist agent for spreadsheet reasoning and manipulation via large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.630830Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:1f46cba745f8694bcaa460b318da01a44d646f55d7ac468744ce56520a64916b","observation_id":"92fc8ac8-3bfe-4a22-8182-e1e3d71620a0","resolution":{"observed_at":"2026-08-04T02:02:24.630830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06724","last_updated":"2025-08-23T21:01:08Z","snapshot_observed_at":"2026-08-06T12:33:24.169001Z","submitted_at":"2024-12-09T18:13:27Z","title":"AutoDCWorkflow: LLM-based Data Cleaning Workflow Auto-Generation and Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06724","snapshot_observed_at":"2026-08-04T02:02:24.664176Z","title":"Autodcworkflow: Llm-based data cleaning workflow auto-generation and benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.664176Z"},"links":{"cited_paper":"/paper/2412.06724","citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:04ba99a39dcf171e2cf40887897bcb819da99998ca7fe1a816ff651303c8ac35","observation_id":"23d57a55-fd37-44de-b31b-d1c211e8e885","resolution":{"observed_at":"2026-08-04T02:02:24.664176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:24.740787Z","title":"Datagovbench: Benchmarking llm agents for real-world data governance workflows,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.740787Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:1bce9c63d7c5b040d84df7c782942c82b04c661b6e37c323c765a4a14f64336c","observation_id":"9da3e50f-bed5-4a35-9d4c-bcdcfb29b3f4","resolution":{"observed_at":"2026-08-04T02:02:24.740787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1508.00305","last_updated":"2015-08-03T02:53:01Z","snapshot_observed_at":"2026-07-06T04:25:37.491871Z","submitted_at":"2015-08-03T02:53:01Z","title":"Compositional Semantic Parsing on Semi-Structured Tables","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.00305","snapshot_observed_at":"2026-08-04T02:02:24.808758Z","title":"Compositional semantic parsing on semi- structured tables,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.808758Z"},"links":{"cited_paper":"/paper/1508.00305","citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:0626c759cc702f69b0e4def94710d06e7b2f4bf921849a0a7cd8f3a938aa99fc","observation_id":"29767ef8-07e4-4400-a225-3f8b76b33b0e","resolution":{"observed_at":"2026-08-04T02:02:24.808758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.02164","last_updated":"2020-06-14T19:14:22Z","snapshot_observed_at":"2026-08-07T22:43:28.600835Z","submitted_at":"2019-09-05T00:25:17Z","title":"TabFact: A Large-scale Dataset for Table-based Fact Verification","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.02164","snapshot_observed_at":"2026-08-04T02:02:24.858361Z","title":"Tabfact: A large-scale dataset for table-based fact verification,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.858361Z"},"links":{"cited_paper":"/paper/1909.02164","citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:d77e16fd4eb3b22db84f5032eeee9aa7c14cd87c7d584557046c5aded26294e7","observation_id":"cd7e1f2e-0a50-4815-b429-1fb8a3ce9e01","resolution":{"observed_at":"2026-08-04T02:02:24.858361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:24.940855Z","title":"Sheetcopilot: Bringing software productivity to the next level through large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.940855Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:ca96b057834961aad5d465829ca94c92d9a90d0d6b7fbc421ff129ffbd891f86","observation_id":"656de7d2-4267-4caf-8a73-b96f76c1d2e0","resolution":{"observed_at":"2026-08-04T02:02:24.940855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:25.045461Z","title":"Wrangler: Interactive visual specification of data transformation scripts,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:25.045461Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:e7383e1b0e646a9fd67bb264ceabadd16456fbc786f0a6d399acf20c5d01ace7","observation_id":"eea4f836-1d92-4f9e-9336-14a0497f3847","resolution":{"observed_at":"2026-08-04T02:02:25.045461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:25.093525Z","title":"Intercode: Stan- dardizing and benchmarking interactive coding with execution feed- back,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:25.093525Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:316cd4560b6abdbe704be1b3c48cb090c9d1607ff3bfb45e1bfa3d85b47087a0","observation_id":"0376c9fd-22f2-46c6-b891-65c3ab056975","resolution":{"observed_at":"2026-08-04T02:02:25.093525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:25.161194Z","title":"Ds-1000: A natural and reliable benchmark for data science code generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:25.161194Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:116fd01d82d4ef84399ebcca935c253bbb657cd44db3ca971e3dcd25a74e1bc2","observation_id":"d4aba903-87b4-4028-b137-19244b34f62b","resolution":{"observed_at":"2026-08-04T02:02:25.161194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:25.247961Z","title":"Tablebench: A comprehensive and complex benchmark for table question answering,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:25.247961Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:0e22476ef8742e23f8930c07b61775752db91e2d6f67529072d95e0b89b23faf","observation_id":"80bb2fab-1604-4083-91f4-1d1d79212355","resolution":{"observed_at":"2026-08-04T02:02:25.247961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:25.300938Z","title":"Realhitbench: A comprehensive realistic hierarchical table benchmark for evaluating llm-based table analysis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:25.300938Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:101d24c79c34328914561039c776368c20bc35aedebd2b4f80a103836d7bc381","observation_id":"ff6730cc-65c3-4663-9aa9-45732b1c002a","resolution":{"observed_at":"2026-08-04T02:02:25.300938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:25.390812Z","title":"Spreadsheetcoder: Formula prediction from semi-structured context,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:25.390812Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:fd819c1a1d7a274df17ce3e104b352c11774a7c131952f65613ccc6ac98bf893","observation_id":"4bf0f05d-b4e0-4b06-85fd-58f0894b31bd","resolution":{"observed_at":"2026-08-04T02:02:25.390812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14495","last_updated":"2023-10-23T02:00:55Z","snapshot_observed_at":"2026-07-06T16:36:51.110530Z","submitted_at":"2023-10-23T02:00:55Z","title":"InstructExcel: A Benchmark for Natural Language Instruction in Excel","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14495","snapshot_observed_at":"2026-08-04T02:02:25.469087Z","title":"Instructexcel: A benchmark for natural language instruction in excel,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:25.469087Z"},"links":{"cited_paper":"/paper/2310.14495","citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:8cb22cbf5aa999209d04b198baab4f63236d24527c31da882b3309fb5f360b77","observation_id":"770b2ba7-be74-4068-93b4-c84a45d1c020","resolution":{"observed_at":"2026-08-04T02:02:25.469087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-08T11:30:35.242922Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-08-04T02:02:25.560821Z","title":"τ-bench: A benchmark for tool-agent-user interaction in real-world domains,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:25.560821Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:6c8c2fe10e6bf56da891758d7e828090b0520210d0a92eeede18fc4058bfb7ed","observation_id":"f5a3bfbd-a7ef-4e93-8a1a-626223eff658","resolution":{"observed_at":"2026-08-04T02:02:25.560821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:25.629189Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:25.629189Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:3f54fe9526b7a2e0826a0604773b3198ddbd24b8e648d3e98f6ed2734320d0f4","observation_id":"4633509a-84cc-45c2-bdf4-8e2933b16ea9","resolution":{"observed_at":"2026-08-04T02:02:25.629189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01747","last_updated":"2025-09-04T16:22:32Z","snapshot_observed_at":"2026-07-06T19:44:34.642049Z","submitted_at":"2024-11-04T02:08:59Z","title":"DynaSaur: Large Language Agents Beyond Predefined Actions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01747","snapshot_observed_at":"2026-08-04T02:02:25.766495Z","title":"Dynasaur: Large language agents beyond predefined actions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:25.766495Z"},"links":{"cited_paper":"/paper/2411.01747","citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:d63637a5990b7a172a4f580802770d6935f6da79b6b2445fd2aea6d01210414c","observation_id":"d742f155-ebfa-4348-9c78-f6068e7a937b","resolution":{"observed_at":"2026-08-04T02:02:25.766495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:25.825097Z","title":"Codeassistbench (cab): Dataset & benchmarking for multi-turn chat-based code assis- tance,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:25.825097Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:7ea626d9d56df31d47735849e839f9faf0d89f54e214a0563451ca4835fce54c","observation_id":"378e043d-e845-4931-9adc-7ffc6bcb9e97","resolution":{"observed_at":"2026-08-04T02:02:25.825097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18223","snapshot_observed_at":"2026-08-04T02:02:25.908482Z","title":"Ida-bench: Evaluating llms on interactive guided data analysis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:25.908482Z"},"links":{"cited_paper":"/paper/2505.18223","citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:fde1d6d878a59c44bef84d7b15c07ed353fc9e6f97c96107e3bdd5c0b45eb647","observation_id":"9a5bb880-d645-4644-bb41-fec033f6c5fa","resolution":{"observed_at":"2026-08-04T02:02:25.908482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:25.968696Z","title":"Learning to ask: When llm agents meet unclear instruction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:25.968696Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:f2604a414acacf8a0e18d7693fd6bbc82637cf311aaf89a7802f2d7a501baf4c","observation_id":"59e10e46-5193-4893-8c77-cf204d9dd732","resolution":{"observed_at":"2026-08-04T02:02:25.968696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:26.083143Z","title":"Clarifymt-bench: Benchmarking and improving multi-turn clarification for conversational large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:26.083143Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:963abaca3cb5b0ca0c2693ece6ac5f7ce2b85112a99540ec4d60b46b85b85dea","observation_id":"569a5ceb-1326-4454-b0c1-6e8016778148","resolution":{"observed_at":"2026-08-04T02:02:26.083143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:26.147012Z","title":"Metagpt: Meta programming for a multi-agent collaborative framework,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:26.147012Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:019e6754877f53a81f02519860d34de2285b4e7c99bb12c873136fce6d01e41c","observation_id":"a740700d-089d-4f31-a57d-3319feaf15d3","resolution":{"observed_at":"2026-08-04T02:02:26.147012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:26.221744Z","title":"Camel: Communicative agents for","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:26.221744Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:cfcf4036fca5f00fba6fbb0703248b43317494bee033eabae6ee26a91db22e8d","observation_id":"dee2d82e-d316-40de-abb6-ffd977b64fe3","resolution":{"observed_at":"2026-08-04T02:02:26.221744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08291","last_updated":"2025-06-02T00:45:04Z","snapshot_observed_at":"2026-08-06T05:57:38.286668Z","submitted_at":"2024-03-13T06:54:15Z","title":"CleanAgent: Automating Data Standardization with LLM-based Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08291","snapshot_observed_at":"2026-08-04T02:02:26.305485Z","title":"Cleanagent: Automating data standard- ization with llm-based agents,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:26.305485Z"},"links":{"cited_paper":"/paper/2403.08291","citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:7cfb77a0fc691b88fc4de639288a730322f421d44a784d3b0891b21279c58597","observation_id":"7a47da4d-3147-46da-83ea-9aded52b7975","resolution":{"observed_at":"2026-08-04T02:02:26.305485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:26.410742Z","title":"Chatdev: Communicative agents for software development,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:26.410742Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:c42509d8410680e3a0fdfe6497b76dbc41b02e0b87f403a9157c2f7bc95ffa59","observation_id":"d2af742e-0cc9-41d3-ae1e-fdee3195647f","resolution":{"observed_at":"2026-08-04T02:02:26.410742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","latest_version":1,"primary_category":"cs.DB","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2608.00018."}