{"as_of":"2026-08-09T02:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:83b3a3c2112a4e2bfeee5fb996eae285043bfc946740f2d918b61ca7756b3f92","coverage":[{"denominator":142,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:46:56.334492Z","state":"measured"},{"denominator":104,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":104,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T02:02:25.908482Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"cited_work":{"arxiv_id":"2505.18223","doi":"10.48550/arxiv.2505.18223","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18223","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ida-bench: Evaluating llms on interactive guided data analysis","venue":"arXiv (Cornell University)","work_id":"12352b65-81bf-4214-b91b-9cbad5d7d5a6","year":2025},"citing_paper":{"arxiv_id":"2605.03808","last_updated":"2026-05-05T14:35:47Z","snapshot_observed_at":"2026-07-06T23:16:40.201701Z","submitted_at":"2026-05-05T14:35:47Z","title":"Agentic-imodels: Evolving agentic interpretability tools via autoresearch","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:43.371592Z"},"links":{"cited_paper":"/paper/2505.18223","citing_paper":"/paper/2605.03808"},"observation_digest":"sha256:c27974e81298152741c5daef17367a09bc66fe5d182b6570e93d7f81bb219513","observation_id":"9a5ed600-2958-4aec-8a75-ad0184b222c7","resolution":{"observed_at":"2026-05-11T23:36:36.195393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"cited_work":{"arxiv_id":"2505.18223","doi":"10.48550/arxiv.2505.18223","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18223","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ida-bench: Evaluating llms on interactive guided data analysis","venue":"arXiv (Cornell University)","work_id":"12352b65-81bf-4214-b91b-9cbad5d7d5a6","year":2025},"citing_paper":{"arxiv_id":"2606.00051","last_updated":"2026-05-08T08:23:10Z","snapshot_observed_at":"2026-08-07T00:25:09.123345Z","submitted_at":"2026-05-08T08:23:10Z","title":"Business Utility of Large Language Models as Exploratory Data Analysis Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T23:25:17.416071Z"},"links":{"cited_paper":"/paper/2505.18223","citing_paper":"/paper/2606.00051"},"observation_digest":"sha256:774506e56916dacde53ae517099472173fba28667252490649e34329b2b134cf","observation_id":"bac24401-0195-4260-9e1c-0f3adccc3009","resolution":{"observed_at":"2026-06-30T23:35:06.971550Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"cited_work":{"arxiv_id":"2505.18223","doi":"10.48550/arxiv.2505.18223","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18223","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ida-bench: Evaluating llms on interactive guided data analysis","venue":"arXiv (Cornell University)","work_id":"12352b65-81bf-4214-b91b-9cbad5d7d5a6","year":2025},"citing_paper":{"arxiv_id":"2606.16000","last_updated":"2026-06-16T21:25:39Z","snapshot_observed_at":"2026-08-02T17:38:04.521168Z","submitted_at":"2026-06-14T19:58:06Z","title":"GRACE-DS: a Guarded Reward-guided Agent Correction Environment in Data Science","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-27T03:42:40.528376Z"},"links":{"cited_paper":"/paper/2505.18223","citing_paper":"/paper/2606.16000"},"observation_digest":"sha256:f804accb482452319c5deea3d2ab8b81b738d5875c979c0453a230c5de3612c2","observation_id":"df93a095-2e57-43a7-984e-0232a0767299","resolution":{"observed_at":"2026-07-03T17:48:46.135475Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18223","snapshot_observed_at":"2026-08-04T02:02:25.908482Z","title":"Ida-bench: Evaluating llms on interactive guided data analysis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-06T23:11:31.471611Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:25.908482Z"},"links":{"cited_paper":"/paper/2505.18223","citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:fde1d6d878a59c44bef84d7b15c07ed353fc9e6f97c96107e3bdd5c0b45eb647","observation_id":"9a5bb880-d645-4644-bb41-fec033f6c5fa","resolution":{"observed_at":"2026-08-04T02:02:25.908482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18223/citation-record","integrity":"/paper/2505.18223/integrity","json":"/paper/2505.18223/citation-record.json","paper":"/paper/2505.18223"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:47.375570Z","title":"https://openai.com/chatgpt/overview/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:47.375570Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:ae13cb61f7da48db680017b0aa45f80f2ffbbbf330c7373dc316106bae0cefbd","observation_id":"ecc08bef-6e53-407b-90a6-bd6714fc6d3b","resolution":{"observed_at":"2026-08-07T14:46:47.375570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:47.422036Z","title":"https://kdigo.org/guidelines/ ckd-evaluation-and-management/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:47.422036Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:fe09194bc494bea93b3d38e8566bf79f1b53aff14151c72500edfeb9cf5778b5","observation_id":"a41767eb-7ca6-4088-954c-269d6eab8387","resolution":{"observed_at":"2026-08-07T14:46:47.422036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:47.538518Z","title":"https://claude.ai/login?returnTo=%2F%3F","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:47.538518Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:6e27fb02915553a309e719f616c281b6d3d7583f59f24e093f0c9fc3086a2dad","observation_id":"0ec5e043-740e-41ab-8cc8-d2b9a2160b9a","resolution":{"observed_at":"2026-08-07T14:46:47.538518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:47.644511Z","title":"https://www.deepseek.com/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:47.644511Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:ba82de7215e17bb29ee887439a867adad5cbbf1c60244246a44f4e86bef4c14e","observation_id":"ed4e1285-fefe-4e8d-b6e1-3edd4299a2fd","resolution":{"observed_at":"2026-08-07T14:46:47.644511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:47.751152Z","title":"https:// playwright.dev/python/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:47.751152Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:e0d7f706db1d7618782c07f0d7219e0ba87d35a524b0ebc7ecaff6c1c398b9d5","observation_id":"17dcf292-639c-4df1-92b5-313b86dbeed5","resolution":{"observed_at":"2026-08-07T14:46:47.751152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:47.835901Z","title":"https://gemini.google.com/app","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:47.835901Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:52e610e18fb17538f9af7b3aeb1fbaf0491f3f0b7422018ce50d813e223c0fdb","observation_id":"12090ef0-2de9-4b51-96f1-f07cf0f1200c","resolution":{"observed_at":"2026-08-07T14:46:47.835901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:47.906553Z","title":"https://grok.com/?ref=findaitools","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:47.906553Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:4717f229b110b1b2e4244988c903078b78205a924a5a6d53ffed0b6fa80983a7","observation_id":"77e27f61-5a20-4d86-9a52-6596c68fba6f","resolution":{"observed_at":"2026-08-07T14:46:47.906553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:48.019029Z","title":"https://openai.com/index/ improvements-to-data-analysis-in-chatgpt/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:48.019029Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:67da5a6c207d0fbfd6c22dd64455acb3dcafd1d7aca20eae433d524da4d9a19c","observation_id":"fd3e7bcf-80ca-424c-b9ed-081d2689aa73","resolution":{"observed_at":"2026-08-07T14:46:48.019029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:48.103552Z","title":"https://www.anthropic.com/news/ analysis-tool","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:48.103552Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:4d9dac3f3fdec795854a643a5c1805d8644dedd9d9194a5a241f811f25f91e34","observation_id":"fcae7a13-e180-435e-b35e-8df02835c009","resolution":{"observed_at":"2026-08-07T14:46:48.103552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:48.197118Z","title":"https://github.com/ jupyterlab/jupyter-ai","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:48.197118Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:9b7c6ce182e589b05d3a5b47c7ebdb196578b1e1426038725425b377ef30ae9b","observation_id":"8e32d172-f5d9-4b65-9f9e-b1af06aa87a9","resolution":{"observed_at":"2026-08-07T14:46:48.197118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:48.280980Z","title":"https://www.kaggle.com/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:48.280980Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:a9b2402a273e998e9425b31fa635019c3baaa8eaafd406a817a8fa12aa906ffc","observation_id":"17cef869-52e8-44ac-818f-818f24ec8b60","resolution":{"observed_at":"2026-08-07T14:46:48.280980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:48.354070Z","title":"https://docs.litellm.ai/docs/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:48.354070Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:c7c77ee3e5e69e0489e24ff76c6fa7264983f434576915f900e63cc8e1e20dbb","observation_id":"220e6105-e3d3-44f4-a087-ef6266520e49","resolution":{"observed_at":"2026-08-07T14:46:48.354070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:48.461121Z","title":"https://www.llama.com/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:48.461121Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:3eb81faf1287be216364842b17dc93000823720eac0c2d634a90b401de77a1f9","observation_id":"b327b415-f453-4565-a74a-c816d7cf279e","resolution":{"observed_at":"2026-08-07T14:46:48.461121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:48.539289Z","title":"https://corporatefinanceinstitute.com/ resources/financial-modeling/modeloff-guide/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:48.539289Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:92340a38c2f9674493490cec15c6c78c8394067c32c1d563bce76c9c32839013","observation_id":"e1af57cb-18b0-401e-bcf5-60318fa7072a","resolution":{"observed_at":"2026-08-07T14:46:48.539289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:48.624374Z","title":"https://openai.com/index/ o3-o4-mini-system-card/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:48.624374Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:44c1af5a73c846cda8abf1ba8295ecb4c9753a75ffd098b18dc76a3b11cf4222","observation_id":"f29a29f3-9504-43be-b4fe-f2acdad40c95","resolution":{"observed_at":"2026-08-07T14:46:48.624374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:48.716807Z","title":"https://kaggle.com/code/alexisbcook/titanic-tutorial","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:48.716807Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:47fbc11fc5d3ba90b71b52551c1dc786ea23e1ce2d65bcfc1957845af515ff51","observation_id":"55ecbb75-05d9-4bc2-a787-3e58880c994e","resolution":{"observed_at":"2026-08-07T14:46:48.716807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:48.823526Z","title":"https://www.vectara.com/blog/ deepseek-r1-hallucinates-more-than-deepseek-v3 , January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:48.823526Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:c8729012f136fe4c27d83b8879b5b04d58e1ab5c8967588575ca86f2c83e17cb","observation_id":"4687eb9c-b3e6-4030-8e45-1afd5713a692","resolution":{"observed_at":"2026-08-07T14:46:48.823526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:48.901910Z","title":"Open Interpreter, May 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:48.901910Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:91b298fd362d4ad582207eedfe4430e082f35f77fe95604272e974fa5c685bc8","observation_id":"a698d4cf-d334-407d-af67-bf19a9a02aef","resolution":{"observed_at":"2026-08-07T14:46:48.901910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:49.002506Z","title":"Wang, Ruoxi Sun, Pengcheng Yin, Caiming Xiong, Ansong Ni, Qian Liu, et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:49.002506Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:38d60ff32f3812090da998ee6a396c6b990d132484e99ec7a49c1a2efa96c105","observation_id":"07a9dd83-13f9-4c37-9576-b59a4c52162f","resolution":{"observed_at":"2026-08-07T14:46:49.002506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:49.146885Z","title":"Beyond Prompts: Dynamic Conversational Benchmarking of Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:49.146885Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:e63844fb8a7e9fbf2a946b63df854c447bfc0eda2d2830f3526f123c50702442","observation_id":"8ad22ae2-09e4-42c1-aab4-d0d2f5cb6386","resolution":{"observed_at":"2026-08-07T14:46:49.146885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:49.237419Z","title":"MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:49.237419Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:a6f5304f8b7b8995cb00d55a4a969e1e132a5362ecb1e72920b459caf19d6c74","observation_id":"2e918e4a-0b65-44f3-9b62-c41910c0a583","resolution":{"observed_at":"2026-08-07T14:46:49.237419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:49.345478Z","title":"Early Childhood Behavioral Inhibition and Social and School Adjustment in Chinese Children: A 5-Year Longitudinal Study","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:49.345478Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:83f045097d4c8a534cec392aee397671c5890242817f5358365178e1e3c4eb5d","observation_id":"df06d733-c902-43df-9227-a54d2731aed1","resolution":{"observed_at":"2026-08-07T14:46:49.345478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:49.442113Z","title":"Behavioral Inhibition in Early Childhood and Adjustment in Late Adolescence in China.Child Development, 92(3):994–1010, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:49.442113Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:ca7ca136b58bab408acf9527f2aeabb103db21b2f466f3d9e32084cef14eb377","observation_id":"eca5cf31-f3d9-4976-a35d-880601388019","resolution":{"observed_at":"2026-08-07T14:46:49.442113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:49.506686Z","title":"Baker, Benjamin Burns, Daniel Adu-Ampratwum, Xuhui Huang, Xia Ning, Song Gao, Yu Su, and Huan Sun","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:49.506686Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:5e25c8353ef39044c15949d80eb46c2c7e791e7a96c6830e549cf5f44d5c67a5","observation_id":"5c903be9-bd00-43ea-b1e0-4fbf847208b4","resolution":{"observed_at":"2026-08-07T14:46:49.506686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:49.644779Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:49.644779Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:b6199c6fefd9917be493f65b3dcdc3cac67bc35843f02e79b617fbad85024aa5","observation_id":"87564adc-cdd4-4ac4-bdad-8f60b51a973e","resolution":{"observed_at":"2026-08-07T14:46:49.644779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:49.774028Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:49.774028Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:2a842a677ae2f9e31e77e006e8bfd5b75127a377efa03b7f6ce5dbff631aeeb2","observation_id":"1e3b15ee-293c-4733-b6e3-4af49fde5232","resolution":{"observed_at":"2026-08-07T14:46:49.774028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:49.890873Z","title":"MIND2WEB: Towards a generalist agent for the web","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:49.890873Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:b31094798c61ccdf223e43f9bdccb97f02b06302636c4e7b79b4149a16e350ca","observation_id":"9ead89f3-e925-4acf-8c66-4ffe2717f0da","resolution":{"observed_at":"2026-08-07T14:46:49.890873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:50.005144Z","title":"Zhang, Lanyi Zhu, Mike A Merrill, Jeffrey Heer, and Tim Althoff","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:50.005144Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:8fdb3710afabf70be88ee3e552374911e318dbc23398528374aac3b6d1d344d6","observation_id":"2fe20fad-f943-4737-bda9-c6edd4795ac7","resolution":{"observed_at":"2026-08-07T14:46:50.005144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:50.104495Z","title":"ConvCodeWorld: Bench- marking Conversational Code Generation in Reproducible Feedback Environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:50.104495Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:b20a16e167e0425422f8d9e56e264619741b7eddc4d24af0f57eb0217dc83312","observation_id":"067149e5-a82c-4071-bb41-2f4c2f1f42f7","resolution":{"observed_at":"2026-08-07T14:46:50.104495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:50.185494Z","title":"InfiAgent-DABench: Evaluating Agents on Data Analysis Tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:50.185494Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:8dfde18511d2d53f6f2054f5518904a55d3a825533b718883fad676b2526f1ca","observation_id":"60934f52-c90c-4d92-92cc-cf81c547b73b","resolution":{"observed_at":"2026-08-07T14:46:50.185494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:50.278411Z","title":"MLAgentBench: Evaluating language agents on machine learning experimentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:50.278411Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:721771f1e1f536c492f1c7349a13c2ba9715c30a0acd7ed8d8b70ab9781c4caf","observation_id":"d5ed60d4-38f9-460b-b43b-87f2e4bb42fa","resolution":{"observed_at":"2026-08-07T14:46:50.278411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:50.397300Z","title":"SimulBench: Evaluating Language Models with Creative Simulation Tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:50.397300Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:ab010dd722d1b3b6143011873ac2adc919d3669fa51ee10d4e6cc6731c78bb5d","observation_id":"00c6d552-a65e-4b11-b0d8-dd904dcedb00","resolution":{"observed_at":"2026-08-07T14:46:50.397300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:50.501633Z","title":"Taylor, and Dan Roth","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:50.501633Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:0b391bca1ab2c5f9b776fc42706a0a3cc56091d243658bbcad430389036e68fa","observation_id":"73a77602-0ddb-4a60-8045-dc76370cd9e9","resolution":{"observed_at":"2026-08-07T14:46:50.501633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:50.600200Z","title":"AIDE: AI-Driven Exploration in the Space of Code, February 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:50.600200Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:bd255da44ef6db1522131c421e07a0308336df0b33bac71915a5266066897a92","observation_id":"df4daca1-9a70-4436-ba7a-c4b4b2c4e9f8","resolution":{"observed_at":"2026-08-07T14:46:50.600200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:50.674757Z","title":"Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:50.674757Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:3605a456c02b94be48d100bebf9a9d8f1ebc070547eafa90a0a74b6670edab7d","observation_id":"55507d96-4c19-4e77-9c5e-00ed4191bdb0","resolution":{"observed_at":"2026-08-07T14:46:50.674757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:50.748889Z","title":"DSBench: How Far Are Data Science Agents from Becoming Data Science Experts? In The Thirteenth International Conference on Learning Representations, October 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:50.748889Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:606f4a61a58c93a3058ad8dd57ea6465c4ef1ab07fcd1e24f82b68f14dee6b81","observation_id":"85873741-2204-46ab-8cf8-1ba307bdc009","resolution":{"observed_at":"2026-08-07T14:46:50.748889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:50.824763Z","title":"LLMs Get Lost In Multi-Turn Conversation, May 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:50.824763Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:36fd1c06baceeb5c8b6ac5b94752cae6f5d456c377d5c0b4945805638efa2664","observation_id":"9b0cbea0-f729-4ed9-b56d-f03645362316","resolution":{"observed_at":"2026-08-07T14:46:50.824763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:50.906565Z","title":"DS-1000: A natural and reliable benchmark for data science code generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:50.906565Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:10b0b9fde1c98ab9a66543615892467a86f71ecf8183d7f3ee63e119933a8b1e","observation_id":"a1199356-618e-42fd-bdfc-e50642333817","resolution":{"observed_at":"2026-08-07T14:46:50.906565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:51.006372Z","title":"Leonard, Nathan Kuppermann, Cody Olsen, Lynn Babcock-Cimpello, Kathleen Brown, Prashant Mahajan, Kathleen M","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:51.006372Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:b10298e5978a1921ff04bb83c4d64bb2b450b4bcdb63b6e5fdcd788d2aaae245","observation_id":"5f43f6a3-b435-41d4-8e79-db623e2813f6","resolution":{"observed_at":"2026-08-07T14:46:51.006372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:51.093050Z","title":"Tapilot-Crossing: Benchmarking and Evolving LLMs Towards Interactive Data Analysis Agents, March 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:51.093050Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:27a445cac39dde9690be7bd2df0e92912a0c3f28ae238a5f19fae5b281eb2804","observation_id":"ed27d3d4-fbaa-41c4-be84-3ad53b669655","resolution":{"observed_at":"2026-08-07T14:46:51.093050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:51.229090Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:51.229090Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:07bb193d5770069811eebdb7cab2f3d6f8d085cad7b4774dfddf4837aa1328c4","observation_id":"2c76353b-32fe-49dc-a1f9-af89600519a1","resolution":{"observed_at":"2026-08-07T14:46:51.229090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:51.348204Z","title":"Nigrovic, Alexander J","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:51.348204Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:6938210e8955c52e85dddb8d6ab7e0751ea6f3f34ad0413a7f47fec356e62eb2","observation_id":"1c0c93ff-7d7d-4af5-9ab0-2ac602e76c00","resolution":{"observed_at":"2026-08-07T14:46:51.348204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:51.447780Z","title":"Missing Women and the Price of Tea in China: The Effect of Sex-Specific Earnings on Sex Imbalance","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:51.447780Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:ebb818255dea2dc9ec7027705351205ede9a22d03a6e4a55baa6fe3093d616f4","observation_id":"4b1a4f80-c4f0-4818-84fc-50219cf352ac","resolution":{"observed_at":"2026-08-07T14:46:51.447780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:51.529329Z","title":"Bishop, Wei Li, Folawiyo Campbell-Ajala, Daniel Kenji Toyama, Robert James Berry, Divya Tyamagundlu, Timothy P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:51.529329Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:bc51a6dfd39fd1e683fca29f6099f88131828b84dd8ccb80893195144f8be6d9","observation_id":"bcdc709e-79db-4d47-9f3f-95d223eb86eb","resolution":{"observed_at":"2026-08-07T14:46:51.529329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:51.643489Z","title":"AutoGPT, May 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:51.643489Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:281178d463998c7888b245e5e80f735ba5a6c520ea06a6bfe88e70db81822f63","observation_id":"73ec0527-2e98-4d3a-97f3-eaa7ef0d0496","resolution":{"observed_at":"2026-08-07T14:46:51.643489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:51.738296Z","title":"Increasing Trans- parency Through a Multiverse Analysis","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:51.738296Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:6e5421e19e2c8dddac8e96a973950c5eaf7f9b1b9fef8a8982619159dacd678d","observation_id":"ef18b500-757c-4525-931c-0ac560ad1db1","resolution":{"observed_at":"2026-08-07T14:46:51.738296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:51.858250Z","title":"Sullivan, Wanze Xie, Stefania Conte, John E","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:51.858250Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:e0a5097bf4359d9e8ee2eade33197db0184600efdf403555073cf7cd4f07ece8","observation_id":"198f234e-32b0-4d2d-ab5b-39686a365605","resolution":{"observed_at":"2026-08-07T14:46:51.858250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:51.942137Z","title":"A macroscope in the redwoods","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:51.942137Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:3daf90c53dc0edfd1d402c506ecc2c47de6e4dd7f6faabb417e29b9c5c2ff575","observation_id":"3e7f517e-40f4-49a4-ae03-559ae0e85d12","resolution":{"observed_at":"2026-08-07T14:46:51.942137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:52.023348Z","title":"Meeseeks: An Iterative Benchmark Evaluating LLMs Multi-Turn Instruction- Following Ability, April 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:52.023348Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:0dcc259ff27c5b79514cca28b19e568da0f4d908210930c8bd9fdb4e7bd64adf","observation_id":"b0f11a23-7418-481d-91f1-20ccdb91cd60","resolution":{"observed_at":"2026-08-07T14:46:52.023348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:52.114734Z","title":"CodeFlowBench: A Multi-turn, Iterative Benchmark for Complex Code Generation, April 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:52.114734Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:1fb7fc158b059e455fcc267facdeeeafb8ac196b857ec062186b4c1424a6924a","observation_id":"30c605ce-766a-424f-80b7-25f95ad3fa4b","resolution":{"observed_at":"2026-08-07T14:46:52.114734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:52.198472Z","title":"White, Doug Burger, and Chi Wang","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:52.198472Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:ce32c110a59b0c4cc5bd21fd04313f2e8de7d72bf86a9e13ba75978dea16d5c4","observation_id":"8a4f9766-4b2d-4c38-b962-8fed31bcdae1","resolution":{"observed_at":"2026-08-07T14:46:52.198472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:52.286596Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:52.286596Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:67ada479317398a218338b3b1d6bc80b7d36ab809d9a8083431a9bced01bc71b","observation_id":"5987d22d-b5c8-4ae0-ad9c-57b282e34dbf","resolution":{"observed_at":"2026-08-07T14:46:52.286596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:52.403469Z","title":"InterCode: Standardizing and benchmarking interactive coding with execution feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:52.403469Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:647f6ed5a254efaeeed83778d823b3fe0038e82f505cf55827a81b9bad670422","observation_id":"294be3d0-06e5-4202-8929-1cbdf00938eb","resolution":{"observed_at":"2026-08-07T14:46:52.403469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:52.503874Z","title":"Narasimhan","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:52.503874Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:d5f40baaa513de0d4a94686b9169cddb9a049470bafda9c0f456252f280623eb","observation_id":"19e12766-6598-4602-8ab0-9bc7d65ded46","resolution":{"observed_at":"2026-08-07T14:46:52.503874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:52.612890Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:52.612890Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:7c14cfd52d779852337608e68bed0c24fa2a8501eae933c227657e898d1dae89","observation_id":"8148cacd-91a5-4586-aa76-da92dcbe8311","resolution":{"observed_at":"2026-08-07T14:46:52.612890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:52.694797Z","title":"Multi-SWE-bench: A Multilingual Benchmark for Issue Resolving, April 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:52.694797Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:5be7795426731afad4803054d09be0baca71295fe0fd02c08701f0812bee7897","observation_id":"6a4904fb-7fca-4e45-9db5-b539db6374c3","resolution":{"observed_at":"2026-08-07T14:46:52.694797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:52.802633Z","title":"Data-Copilot: Bridging Billions of Data and Humans with Autonomous Workflow","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:52.802633Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:1268a3624693b990e938d9d3515de1b59e2f57b28aeeadbead60d52aa0110f62","observation_id":"4b4f32a7-31a7-4744-bce7-7c995da0c51b","resolution":{"observed_at":"2026-08-07T14:46:52.802633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:52.895292Z","title":"Benchmarking Data Science Agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:52.895292Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:bf5dba10ca8d587f996dc1ae9e67308f72ef5e2e8b9dd1648c460284bcfc42d3","observation_id":"5e4f68f8-7906-4b43-8340-c8a768d3462f","resolution":{"observed_at":"2026-08-07T14:46:52.895292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:53.012811Z","title":"Decision Company","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:53.012811Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:b0a8331ead90544c67c1b2e0ebc453ac0fa508a4de8cff1ab34e02249057d8a4","observation_id":"d62c35ab-2a66-4820-a555-1998df3afb02","resolution":{"observed_at":"2026-08-07T14:46:53.012811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:53.058249Z","title":"- Before taking consequential actions that update the dataset, list the action details and obtain explicit user confirmation (yes) to proceed","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:53.058249Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:3ccb28676f0fc85868503fa2fc04d34e238913e8d718ce883d41176eab2c7c8e","observation_id":"356f18bc-fadf-4c13-bec4-a7172f015410","resolution":{"observed_at":"2026-08-07T14:46:53.058249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:53.129886Z","title":"- Output: Use print() exclusively -- no but no other methods (e.g., plt.show(), returns)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:53.129886Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:1b682d6485fd58da15c442cf58b0346f2ce6805d8ab55bbdb61597b021a5e517","observation_id":"6819f32e-4dc1-4839-9183-084ef4b1f2e6","resolution":{"observed_at":"2026-08-07T14:46:53.129886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:53.208871Z","title":"- Adding analysis beyond the requested task","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:53.208871Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:d1b8fcc304403346c68d10377769d673666f77a6cd4ddf7652b52dcef9441d34","observation_id":"4911b584-05ff-4b84-ae10-f91610a2d0e4","resolution":{"observed_at":"2026-08-07T14:46:53.208871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:15.278460Z","title":"The user has given you full permission to execute any code necessary to complete the task","venue":null,"work_id":"5566adce-a3f7-4d1a-b6c9-246403edbc2c","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:53.289214Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:42a14cdced6d79db3ce4244568e981ce82ca050f3ec3df75262adbf6fb5c9b40","observation_id":"eefe7998-fe8e-4f12-b1ca-ba53432410a1","resolution":{"observed_at":"2026-08-07T14:47:15.354088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:15.147634Z","title":"guardian","venue":null,"work_id":"17b36131-22ce-4c4f-815c-e1137f8d78c8","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:53.350669Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:e7a5e09dd39180e525d1a5510e466d3f028ec8a6a7305d2093f3ec386198635c","observation_id":"c95f9d02-1841-4e00-ba1b-1acacb25a166","resolution":{"observed_at":"2026-08-07T14:47:15.197973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:14.963389Z","title":null,"venue":null,"work_id":"fd0ba692-9308-481c-9f1a-0520740adf7e","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:53.432085Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:2e66dd044d6eb3778a451924ecd9895f4fa1ae0c72e64dee729d110b4bd51bce","observation_id":"b3942cd9-059d-4da6-88ae-4049c85a5310","resolution":{"observed_at":"2026-08-07T14:47:15.055000Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:14.760129Z","title":null,"venue":null,"work_id":"77f155a4-26d5-4c5c-baa6-f190dfd87131","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:53.507249Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:e7edfeaf8104b96b50c5d6b6f1301d8c5db25cde05d4a21432f0729c5b6a3026","observation_id":"0b1cde42-b2f0-4c08-9dbf-e4f9a4c1614c","resolution":{"observed_at":"2026-08-07T14:47:14.884560Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:14.591276Z","title":"thought\": <the reasoning process of the gatekeeper>","venue":null,"work_id":"d999b516-0b24-4321-b5f8-019d69be251f","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:53.617722Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:ad7029df0842928960d323d3f88cc961645473a3b327a9b27ddcc15d6b96831f","observation_id":"9f9fd221-fe99-4e1b-ba9d-f6a10dd73f03","resolution":{"observed_at":"2026-08-07T14:47:14.662236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:14.411523Z","title":null,"venue":null,"work_id":"dd06ce26-165f-49fb-a104-3ae53e175ece","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:53.700268Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:7a4203e9b1a6dc894fc51d7c2377894116cc5bac5bb26b85c0a57eea64a9da0b","observation_id":"5b0bf50f-dd18-45ff-a0b3-ecbadae7a6ed","resolution":{"observed_at":"2026-08-07T14:47:14.510799Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:14.246041Z","title":null,"venue":null,"work_id":"00a26332-a95c-424b-aa9e-e0ab53ea0cb1","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:53.779862Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:5791031ea0b170f8b5bc14c0e86ea10fce9305634e58f896236a5259e4df9346","observation_id":"9ecef980-519c-420c-8b61-72bc50a6aab4","resolution":{"observed_at":"2026-08-07T14:47:14.332655Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:14.097903Z","title":null,"venue":null,"work_id":"6edb3d51-bca3-45a7-be18-0318ba0ab11b","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:53.867111Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:bf04d289f1404e04930a800e506f94945d461b753a2b50e2b4a787481b3cd4c9","observation_id":"d2cbaf3f-d01f-4685-8765-34bd666e477b","resolution":{"observed_at":"2026-08-07T14:47:14.170602Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:13.909455Z","title":null,"venue":null,"work_id":"7fe0199b-f9e0-4843-87ee-f047d8c2a0cb","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:53.958532Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:6f4f6169d2a1ed6931d1b54cf28f7b4ad3ef59a4063e67cf399b6b46d212e531","observation_id":"f798acac-d199-4eaf-8436-5a45dfc08f4b","resolution":{"observed_at":"2026-08-07T14:47:14.013419Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:13.710008Z","title":null,"venue":null,"work_id":"c5993a54-928e-42f1-9278-84a5f877d890","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:54.036650Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:c769eec6802bf8ef83a1bd1e56f010af4fac2e1c773d21a06c064ad5c9f138d1","observation_id":"5b4abff3-8beb-49f7-a7c1-3d50a7690256","resolution":{"observed_at":"2026-08-07T14:47:13.796341Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:13.485723Z","title":null,"venue":null,"work_id":"cd362e8f-db6b-400e-a0c0-c7f598d2451c","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:54.108835Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:16c8a4f3c71277d63c125a66a11f5524414798b619d97f4014325c4935672f4f","observation_id":"abc896a7-b9fd-408f-bd0a-846072760919","resolution":{"observed_at":"2026-08-07T14:47:13.576523Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:13.295730Z","title":"(omitted)","venue":null,"work_id":"a6414a86-826a-45fa-9f51-5911aa4b8dd1","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:54.172031Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:189daf3d007a5cad7413dd9f7154b7e6b9f6ab45d9f122569c35b8ca7e87b8c3","observation_id":"ced03377-9381-4161-b85c-b220bf757368","resolution":{"observed_at":"2026-08-07T14:47:13.388357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:13.140928Z","title":null,"venue":null,"work_id":"92622e29-d427-40cb-bfa3-cc061eaddce7","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:54.243031Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:2261bbdcf4ac38a2533f8e8a04fd7b2592bb34d6200611bc00cfb1469b71ceb4","observation_id":"f573cfbc-36ef-446e-9573-f9839bb84492","resolution":{"observed_at":"2026-08-07T14:47:13.205552Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:12.936017Z","title":null,"venue":null,"work_id":"090982ac-f7e3-4d9f-bdc2-76610cea76ae","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:54.329557Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:973f3d32ef3d600c3f8b8f32ae10646757ff0022bc67347f6a99b8f3208fbbe4","observation_id":"39e1111c-a514-4bee-852a-aaaffe5bf422","resolution":{"observed_at":"2026-08-07T14:47:13.032118Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:12.713870Z","title":"System prompt of the shard user","venue":null,"work_id":"3a68fd1a-bee2-4fb5-8c31-3728fd809bd8","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:54.387429Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:2f27fee87ff7445526afac44e9c2854349f1e89b7796ed94846a183e222a45f2","observation_id":"0586bd0d-8a26-4cba-a80f-608b5376abc3","resolution":{"observed_at":"2026-08-07T14:47:12.801042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:12.548113Z","title":"You should select shards that are most “basic” and currently **the most relevant**","venue":null,"work_id":"b1933475-ee11-48ba-bf80-4565d6e88be9","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:54.438122Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:481ef1090ed21cc1fa3e37fcbf5b8f6b6a353a5aebc00dc443b27d1d2bbbfb6b","observation_id":"fe421636-1cda-4752-a4c7-0e1811b0524d","resolution":{"observed_at":"2026-08-07T14:47:12.612789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:12.326960Z","title":null,"venue":null,"work_id":"217990e6-bcee-414c-818f-b3d2d0fd592a","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:54.498573Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:2870c45a0a355f448e9ddbcc9d305f328a78037fbfe2b63738b1c8531ffd9d88","observation_id":"61eec6c3-82a6-45fd-8c99-afb6f1dbf4b4","resolution":{"observed_at":"2026-08-07T14:47:12.444651Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:12.118053Z","title":null,"venue":null,"work_id":"e3902525-ce83-4fc3-9a90-e990047233b9","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:54.563626Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:8fe2517e482a894c32268c45dfd8b29babf3f60855a4c22ba6e1eae1bb96fc5d","observation_id":"01998609-5024-4963-9a26-b7ac132e56a3","resolution":{"observed_at":"2026-08-07T14:47:12.215315Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:11.919729Z","title":null,"venue":null,"work_id":"4e519b12-b225-4847-aeca-6115825b1b5d","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:54.632882Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:186025f4deb3b93ddeb28ebc0c03091e90abe778bf4a9003181dee7aa8b7a680","observation_id":"a00a1721-ac01-4169-a434-4132f4fa254e","resolution":{"observed_at":"2026-08-07T14:47:12.010602Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:11.655923Z","title":"Consider these alternative directions:","venue":null,"work_id":"bbfd1057-014d-4f9a-87b7-cbca9df878f4","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:54.697431Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:7af05e8d90de78e37e3893cb183f06b8951669506e5029363d3e3b9f2ef74bf5","observation_id":"68fd14cb-7d3b-49db-a844-7b2ec6880530","resolution":{"observed_at":"2026-08-07T14:47:11.782448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:11.429970Z","title":null,"venue":null,"work_id":"5d7a1a44-2e5e-4201-a17f-90009461060f","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:54.750391Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:7df90df16b7f9f4b30213faf79f6bc4b88adf570ca9f7625ce9a6ff54aedba9e","observation_id":"c0640aac-3e59-48a3-8f5f-f7751b82b3d3","resolution":{"observed_at":"2026-08-07T14:47:11.515593Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:11.230067Z","title":"thought\":","venue":null,"work_id":"f134e1f0-fbc3-4997-8c84-4bf6b061d378","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:54.817573Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:61313b8318bbda1c57ab03aeffecc17c817cbdcfca8c2429d1d8a24103d0902f","observation_id":"e03f52fd-6f48-4e9e-a905-5be12ffb984c","resolution":{"observed_at":"2026-08-07T14:47:11.322347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:11.068707Z","title":"These metrics typically possess a theoretical upper bound (e.g., 1.0 for accuracy)","venue":null,"work_id":"921b2bbc-6858-4616-94c0-002392763137","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:54.876902Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:6e18db5d8414f3e98d4dcc3adbc4ffeeba9c6bc013d1dc903222692a8f4a1eae","observation_id":"08b44ea8-7e94-43b7-ae2c-59c7fe631b6d","resolution":{"observed_at":"2026-08-07T14:47:11.133038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:10.920817Z","title":"Avg Score","venue":null,"work_id":"a6809f84-58b8-41a2-b8e3-e16ca7e27df3","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:54.963256Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:00d0d533bd7e8c398997172e61037a8f3b2df5369d29e71e9cb828a4d17a6416","observation_id":"3867b804-24e2-44c1-a911-bfdd99025404","resolution":{"observed_at":"2026-08-07T14:47:10.993255Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:10.718085Z","title":null,"venue":null,"work_id":"56441d79-e40a-4ad6-b5af-800b440a44c9","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:55.111812Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:f67dd2a644da65e2c2c9783f890c118c3746599d3a90d3c6d57d317b32449347","observation_id":"5ece733e-534c-4558-a899-a6602b0b4ade","resolution":{"observed_at":"2026-08-07T14:47:10.812818Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:10.490861Z","title":null,"venue":null,"work_id":"d22b56d7-5c13-4f25-80d7-c36fe008468c","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:55.260964Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:c1852fc1218cf5c167b41fa94b1f350427195d7666bfe5a73bd2183e8cf82077","observation_id":"452d1b4f-bbd5-4d27-87f7-d38268ccd254","resolution":{"observed_at":"2026-08-07T14:47:10.593754Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:10.282248Z","title":null,"venue":null,"work_id":"b2b82290-ce26-4f25-b352-474a5a46c779","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:55.352626Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:dc207315786be5514548bf49776ea3804b8f15d585c349cc07cadeb993c46a0c","observation_id":"5f2437a7-1f80-4206-8c1e-61437968fecf","resolution":{"observed_at":"2026-08-07T14:47:10.372803Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:10.092927Z","title":null,"venue":null,"work_id":"01996251-67d4-40c7-8c3d-9d515366ca7f","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:55.451451Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:b85f97c6674a17784fe8b32aed5a690cb6a9d8752a02fac480e8a6998178b621","observation_id":"3e3b5a8e-27f3-4c71-80d0-ea858804a528","resolution":{"observed_at":"2026-08-07T14:47:10.202351Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:09.972133Z","title":"metric_name","venue":null,"work_id":"3040978e-e51b-40dd-9957-534cfcc777ad","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:55.590513Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:7a5f76e31d9ce46c50eae1b77e0a59385532bbb1b2868cebd85ff50fab078030","observation_id":"ab1d6e91-d1a7-4be2-9b8c-69ccf5b7bffc","resolution":{"observed_at":"2026-08-07T14:47:10.045925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:09.803522Z","title":"yes\" -> 1 and","venue":null,"work_id":"50b767ee-88dc-40f7-95e7-52943d7cc6c1","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:55.662945Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:4f13cac1a0ba438756c4723a2d677d18b6ecd145c6c59c3e9d905226d64ac21c","observation_id":"7ad91a31-f9e9-4e82-8625-b0d07e08bea2","resolution":{"observed_at":"2026-08-07T14:47:09.885569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:09.586397Z","title":null,"venue":null,"work_id":"fb36fa58-32ef-48a3-bdc2-ce0083f59f06","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:55.725076Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:53cf1999c27b1867f0108e7c90943d8ad4f3b09d9e8628d3eabb734bf381e5ad","observation_id":"8d0d2a8d-68b6-4efa-b0dc-f8fab30074b6","resolution":{"observed_at":"2026-08-07T14:47:09.699479Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:09.361793Z","title":null,"venue":null,"work_id":"57ffa8c2-e7b2-437d-9625-6998d89f1c43","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:55.783517Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:0d2d06536daae143b0af0860006af8e5801e32e11157073f8ff62ebb9474fe82","observation_id":"2071ba24-4855-49a0-bb2e-cbf4492b39ba","resolution":{"observed_at":"2026-08-07T14:47:09.470809Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:09.155952Z","title":null,"venue":null,"work_id":"447254f7-26c3-4c35-8c83-a998796e02aa","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:55.853949Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:d8616b43263acfe20dca86ba3cdd4dd267bee6662d7448a1cd93996af7acec2a","observation_id":"fb5b5414-d716-406e-bd25-f1b24032addf","resolution":{"observed_at":"2026-08-07T14:47:09.259524Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:08.973343Z","title":null,"venue":null,"work_id":"92b56f2a-edbe-49f3-a362-e985ae5b468f","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:55.932041Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:7c659c1c8ea6cd30acc2bd50cda344e12c6f126428ad76c25723d4381998869f","observation_id":"1fa1beae-08ab-4a36-98b7-65eaefcfe2d3","resolution":{"observed_at":"2026-08-07T14:47:09.047479Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:08.763479Z","title":"<markdown>","venue":null,"work_id":"f962081b-d6a2-498c-9940-122910e93ac7","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:56.019587Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:1e1cbbc371d7a29983340dbc4cc193dc195f096dead654b8011dc7997de6dc4a","observation_id":"05224c24-238a-41a0-a667-85a3968efa4e","resolution":{"observed_at":"2026-08-07T14:47:08.852908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:08.592759Z","title":"!pip install","venue":null,"work_id":"062b70fb-51a4-4704-8cca-cf2f750ab25f","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:56.091977Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:f24c6acc3a85c0b56960c4af59086c408475fbdeee35ad98df81a9dfb5d6a8a6","observation_id":"770a40a6-c077-4eb1-9a81-4041e4ac5ce7","resolution":{"observed_at":"2026-08-07T14:47:08.668817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:08.378133Z","title":"- Load the test feature set from the given directory, using <original_name>_test_features","venue":null,"work_id":"cfd3e7ab-0c15-45ad-a780-915ad47a0829","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:56.212625Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:09ea735e01da473a7d4ae4d5a533e172f0b29cbfe0602def3fa03d4108a60618","observation_id":"b231fb36-f85a-4075-98aa-a770e510818f","resolution":{"observed_at":"2026-08-07T14:47:08.478825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:08.137018Z","title":"- Apply the identical transformations to the test feature set","venue":null,"work_id":"a7dbee5f-2df9-4e35-924d-06221ae04d63","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:56.334492Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:7315a8a8193caca8231ba8a9a89423fd50a3918da0ff1d5a621bac21dd712048","observation_id":"144be1e0-9337-44e8-a6e4-a05306a4f790","resolution":{"observed_at":"2026-08-07T14:47:08.224725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T14:40:35.240838Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":84,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":142},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 142 outbound references and 4 inbound Pith citation observations for arXiv:2505.18223."}