{"as_of":"2026-08-09T05:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9ea5acbaf655e7fea8731b5785513cc97129280c5dd911148a097ab69a860e85","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:37:54.197640Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":20,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:53:23.455387Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-06T10:53:23.455387Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.23336","last_updated":"2025-08-06T18:41:57Z","snapshot_observed_at":"2026-08-06T10:53:21.465965Z","submitted_at":"2025-07-31T08:32:37Z","title":"DSBC : Data Science task Benchmarking with Context engineering","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T10:53:23.455387Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2507.23336"},"observation_digest":"sha256:03649376a5268d7cc4b969fd02439e9c94284e66035381790ce08cfcdee92dfc","observation_id":"fb3c064e-2200-47d6-b291-ba24dc973c63","resolution":{"observed_at":"2026-08-06T10:53:23.455387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-05T11:38:48.980923Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02473","last_updated":"2026-05-29T10:01:49Z","snapshot_observed_at":"2026-08-08T14:12:42.899661Z","submitted_at":"2025-09-02T16:25:12Z","title":"FDABench: A Benchmark for Data Agents on Analytical Queries over Heterogeneous Data","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:48.980923Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2509.02473"},"observation_digest":"sha256:e2e9930cbd709faccbe4a2c2ac45cd210c3ffc9fa2dd8909c1e68c43c34f648b","observation_id":"3acc66b7-f3e8-4d21-bf40-9a6157ddbd12","resolution":{"observed_at":"2026-08-05T11:38:48.980923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":"2506.23719","doi":"10.48550/arxiv.2506.23719","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dabstep: Data agent benchmark for multi-step reasoning","venue":"ArXiv.org","work_id":"85862d27-eefc-4f5e-aa5d-26d6d6b7b24e","year":2025},"citing_paper":{"arxiv_id":"2512.13168","last_updated":"2026-04-15T17:46:00Z","snapshot_observed_at":"2026-08-08T14:46:54.054418Z","submitted_at":"2025-12-15T10:28:45Z","title":"Finch: Benchmarking Finance & Accounting across Spreadsheet-Centric Enterprise Workflows","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T22:43:48.618334Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2512.13168"},"observation_digest":"sha256:7edb9983d66e9e47b0efc336e17c9d32486199feefed7d86355d7dd7b9148faa","observation_id":"791502ba-261b-4ae2-9413-05d8da1a7934","resolution":{"observed_at":"2026-05-16T22:48:38.295576Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":"2506.23719","doi":"10.48550/arxiv.2506.23719","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dabstep: Data agent benchmark for multi-step reasoning","venue":"ArXiv.org","work_id":"85862d27-eefc-4f5e-aa5d-26d6d6b7b24e","year":2025},"citing_paper":{"arxiv_id":"2604.10516","last_updated":"2026-04-26T12:24:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T08:14:39Z","title":"Structure-Grounded Knowledge Retrieval via Code Dependencies for Multi-Step Data Reasoning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T15:37:27.639628Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2604.10516"},"observation_digest":"sha256:6603b9e319fae5c46dae1b96f2fec2c6711263f73f3df8ad7cfab2a1d0e5cae9","observation_id":"61775897-6a07-44a1-94e7-af61958cd931","resolution":{"observed_at":"2026-05-11T10:11:02.007616Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":"2506.23719","doi":"10.48550/arxiv.2506.23719","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dabstep: Data agent benchmark for multi-step reasoning","venue":"ArXiv.org","work_id":"85862d27-eefc-4f5e-aa5d-26d6d6b7b24e","year":2025},"citing_paper":{"arxiv_id":"2604.16682","last_updated":"2026-04-17T20:39:25Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T20:39:25Z","title":"KAIROS: Stateful, Context-Aware Power-Efficient Agentic Inference Serving","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T06:58:36.525442Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2604.16682"},"observation_digest":"sha256:9e3f3b5910ecc070c030b9241ee211a728bad8a28efd0de42ccacd7b514bb763","observation_id":"460546be-bfd7-4a7a-b7ef-6f93de34232d","resolution":{"observed_at":"2026-05-10T07:01:48.825266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":"2506.23719","doi":"10.48550/arxiv.2506.23719","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dabstep: Data agent benchmark for multi-step reasoning","venue":"ArXiv.org","work_id":"85862d27-eefc-4f5e-aa5d-26d6d6b7b24e","year":2025},"citing_paper":{"arxiv_id":"2605.02503","last_updated":"2026-05-27T09:45:47Z","snapshot_observed_at":"2026-08-02T19:40:05.951592Z","submitted_at":"2026-05-04T11:57:09Z","title":"DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T18:24:15.160643Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2605.02503"},"observation_digest":"sha256:761532faccd62576c5e948abdca7b01f3973da731611cddf67d23de6b8eb240b","observation_id":"f49fc793-54bd-435d-a09e-278b60ad2148","resolution":{"observed_at":"2026-05-09T06:30:42.409816Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":"2506.23719","doi":"10.48550/arxiv.2506.23719","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dabstep: Data agent benchmark for multi-step reasoning","venue":"ArXiv.org","work_id":"85862d27-eefc-4f5e-aa5d-26d6d6b7b24e","year":2025},"citing_paper":{"arxiv_id":"2605.02503","last_updated":"2026-05-27T09:45:47Z","snapshot_observed_at":"2026-08-02T19:40:05.951592Z","submitted_at":"2026-05-04T11:57:09Z","title":"DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T00:25:32.898938Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2605.02503"},"observation_digest":"sha256:df40e723a2f9f5fddc7a99ac8f589a0e98eaf38d1cb2c182fc0ce7ba7b24acfb","observation_id":"0b1f780e-650b-4329-ae03-04d19bb71f99","resolution":{"observed_at":"2026-05-21T00:29:17.482393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":"2506.23719","doi":"10.48550/arxiv.2506.23719","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dabstep: Data agent benchmark for multi-step reasoning","venue":"ArXiv.org","work_id":"85862d27-eefc-4f5e-aa5d-26d6d6b7b24e","year":2025},"citing_paper":{"arxiv_id":"2605.02503","last_updated":"2026-05-27T09:45:47Z","snapshot_observed_at":"2026-08-02T19:40:05.951592Z","submitted_at":"2026-05-04T11:57:09Z","title":"DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-01T00:19:52.480293Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2605.02503"},"observation_digest":"sha256:21568413359f1e887cbba42a386afbd8be5845607de89c059fc223b60827f45b","observation_id":"ccecea1c-66f2-4f47-b2d0-bd498e94c771","resolution":{"observed_at":"2026-07-01T00:25:09.627139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":"2506.23719","doi":"10.48550/arxiv.2506.23719","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dabstep: Data agent benchmark for multi-step reasoning","venue":"ArXiv.org","work_id":"85862d27-eefc-4f5e-aa5d-26d6d6b7b24e","year":2025},"citing_paper":{"arxiv_id":"2605.08687","last_updated":"2026-05-09T04:52:47Z","snapshot_observed_at":"2026-08-03T23:56:12.463996Z","submitted_at":"2026-05-09T04:52:47Z","title":"PrepBench: How Far Are We from Natural-Language-Driven Data Preparation?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T01:01:40.043634Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2605.08687"},"observation_digest":"sha256:625cfd437d5ac6fb13c3df83d413d9ae3b933f98a7b83821e539951471fb45d4","observation_id":"8c5a8580-4aa7-4c60-a654-f250986eebe3","resolution":{"observed_at":"2026-05-12T08:31:25.531288Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":"2506.23719","doi":"10.48550/arxiv.2506.23719","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dabstep: Data agent benchmark for multi-step reasoning","venue":"ArXiv.org","work_id":"85862d27-eefc-4f5e-aa5d-26d6d6b7b24e","year":2025},"citing_paper":{"arxiv_id":"2605.21338","last_updated":"2026-05-20T16:05:05Z","snapshot_observed_at":"2026-07-06T23:31:46.877766Z","submitted_at":"2026-05-20T16:05:05Z","title":"Text Analytics Evaluation Framework: A Case Study on LLMs and Social Media","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-21T04:52:44.897900Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2605.21338"},"observation_digest":"sha256:8cf804c375d358b5379f579fc95a491d0df8cb79109fa358859b2eb81c024285","observation_id":"3e073fb7-07c5-4eb4-8c3c-8895a3ed457b","resolution":{"observed_at":"2026-05-21T04:53:57.793262Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":"2506.23719","doi":"10.48550/arxiv.2506.23719","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dabstep: Data agent benchmark for multi-step reasoning","venue":"ArXiv.org","work_id":"85862d27-eefc-4f5e-aa5d-26d6d6b7b24e","year":2025},"citing_paper":{"arxiv_id":"2605.26297","last_updated":"2026-05-25T19:45:21Z","snapshot_observed_at":"2026-08-03T04:38:08.316378Z","submitted_at":"2026-05-25T19:45:21Z","title":"Agentic AI Workload Characteristics","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T20:11:50.722787Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2605.26297"},"observation_digest":"sha256:d1ac58a7cc2f2196df52b8e9e37b7b6bbcc9fc03ad6eac4c54a44c0152f90644","observation_id":"1f99a9bc-e4d2-4d84-9274-6d901d19469c","resolution":{"observed_at":"2026-06-29T20:13:58.838083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":"2506.23719","doi":"10.48550/arxiv.2506.23719","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dabstep: Data agent benchmark for multi-step reasoning","venue":"ArXiv.org","work_id":"85862d27-eefc-4f5e-aa5d-26d6d6b7b24e","year":2025},"citing_paper":{"arxiv_id":"2605.30434","last_updated":"2026-05-28T18:00:20Z","snapshot_observed_at":"2026-07-06T23:39:43.967889Z","submitted_at":"2026-05-28T18:00:20Z","title":"LongDS-Bench: On the Failure of Long-Horizon Agentic Data Analysis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T08:56:24.657380Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2605.30434"},"observation_digest":"sha256:5258b0a3eb1934db762a167c170b5b7d64bfb3219ae681be525e864ead3a75f7","observation_id":"96694f58-b1a6-4369-bcc7-b9e9f682099e","resolution":{"observed_at":"2026-06-29T09:03:16.042821Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":"2506.23719","doi":"10.48550/arxiv.2506.23719","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dabstep: Data agent benchmark for multi-step reasoning","venue":"ArXiv.org","work_id":"85862d27-eefc-4f5e-aa5d-26d6d6b7b24e","year":2025},"citing_paper":{"arxiv_id":"2606.00384","last_updated":"2026-06-07T19:48:24Z","snapshot_observed_at":"2026-08-08T23:35:17.895270Z","submitted_at":"2026-05-29T21:57:37Z","title":"VESTA: Visual Exploration with Statistical Tool Agents","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T21:58:11.339217Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2606.00384"},"observation_digest":"sha256:86a024605467b4689c74392333931e2e7f6ff6a4fb20468b484b8e5176857f85","observation_id":"886e156f-5d39-488e-870b-2fbb2dc4bde2","resolution":{"observed_at":"2026-07-01T19:56:10.467893Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":"2506.23719","doi":"10.48550/arxiv.2506.23719","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dabstep: Data agent benchmark for multi-step reasoning","venue":"ArXiv.org","work_id":"85862d27-eefc-4f5e-aa5d-26d6d6b7b24e","year":2025},"citing_paper":{"arxiv_id":"2606.06416","last_updated":"2026-06-04T17:20:47Z","snapshot_observed_at":"2026-07-06T23:46:15.936608Z","submitted_at":"2026-06-04T17:20:47Z","title":"Unsupervised Skill Discovery for Agentic Data Analysis","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T01:13:03.634348Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2606.06416"},"observation_digest":"sha256:9511e1cd2b17da5152d22c250f2851d21700e8e4c0ce9547c463a04b8e295ce2","observation_id":"dcd5dbcc-62f6-4266-b7f2-0a5ca6772369","resolution":{"observed_at":"2026-06-28T01:21:29.003098Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":"2506.23719","doi":"10.48550/arxiv.2506.23719","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dabstep: Data agent benchmark for multi-step reasoning","venue":"ArXiv.org","work_id":"85862d27-eefc-4f5e-aa5d-26d6d6b7b24e","year":2025},"citing_paper":{"arxiv_id":"2606.16000","last_updated":"2026-06-16T21:25:39Z","snapshot_observed_at":"2026-08-02T17:38:04.521168Z","submitted_at":"2026-06-14T19:58:06Z","title":"GRACE-DS: a Guarded Reward-guided Agent Correction Environment in Data Science","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-27T03:42:40.528376Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2606.16000"},"observation_digest":"sha256:40cc93d99f547b3ff4f147ec210455133f2fe01fc232babd576db4326dcedd88","observation_id":"8c333f4e-6b57-4919-93b9-576aafae6069","resolution":{"observed_at":"2026-07-03T17:48:46.123976Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-02T02:18:45.651355Z","title":"arXiv preprint arXiv:2506.23719 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14386","last_updated":"2026-07-15T22:01:21Z","snapshot_observed_at":"2026-08-08T01:19:24.103488Z","submitted_at":"2026-07-15T22:01:21Z","title":"CIPHER: A Decoupled Exploration-Selection Framework for Test-Time Scaling of Data Science Agents","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-02T02:18:45.651355Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2607.14386"},"observation_digest":"sha256:458d914c474f11f7c906dad2d5bd2d6860de55f8833a3f2837c0ac8e2acb328c","observation_id":"cdcd41e0-5419-459c-81eb-a60d331ce251","resolution":{"observed_at":"2026-08-02T02:18:45.651355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-01T22:27:23.366415Z","title":"Dabstep: Data agent benchmark for multi-step reasoning.arXiv preprint arXiv:2506.23719, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15766","last_updated":"2026-07-17T08:56:43Z","snapshot_observed_at":"2026-08-07T15:17:36.970238Z","submitted_at":"2026-07-17T08:56:43Z","title":"Before the Action: Benchmarking LLMs on Prospective Hypothesis Discovery","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T22:27:23.366415Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2607.15766"},"observation_digest":"sha256:9a359afc3d481af4e2f3fe52ad4ae55d750076d7ec11cc4c4045b40abbfd2340","observation_id":"4841dbd9-2b56-4d6f-86b1-d410a2e6897b","resolution":{"observed_at":"2026-08-01T22:27:23.366415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-01T01:16:43.824531Z","title":"arXiv preprint arXiv:2506.23719 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-06T22:52:32.781663Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:43.824531Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:d51bb549b8d21a78524546a006044f0838ecf626f80009e97d2f43cf94a1eb47","observation_id":"476bc867-a9d9-4d3b-afc6-a0fe2646229b","resolution":{"observed_at":"2026-08-01T01:16:43.824531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-07-30T22:55:11.426393Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26724","last_updated":"2026-07-29T10:14:02Z","snapshot_observed_at":"2026-08-08T09:28:44.467335Z","submitted_at":"2026-07-29T10:14:02Z","title":"UrbanDS: A Graph-Guided LLM Multi-Agent System for Data-Intensive Urban Tasks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-30T22:55:11.426393Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2607.26724"},"observation_digest":"sha256:08dc3bde1ce92e97f6e893acdb6844fe764319ba536da6591e42eb53a633c53b","observation_id":"b9c22f85-25f8-41b1-8fae-261cc4c9ba4c","resolution":{"observed_at":"2026-07-30T22:55:11.426393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-07-31T19:54:08.368823Z","title":"Kingma, Leandro von Werra, and Thomas Wolf","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.368823Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:484014cb54d091c33944efad76def165927c6f915ec5a50eb466cbf3acac2411","observation_id":"2b6306c8-17af-4a00-bd30-9d2331ff07a6","resolution":{"observed_at":"2026-07-31T19:54:08.368823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.23719/citation-record","integrity":"/paper/2506.23719/integrity","json":"/paper/2506.23719/citation-record.json","paper":"/paper/2506.23719"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.275970Z","title":"Llama 3.2: Revolutionizing edge ai and vision with open, customizable models","venue":null,"work_id":"54f63029-ce98-45bb-b944-b8855239046f","year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:50.333473Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:aca7348f0da56c019cb6f018b2829ecd801e1df6c7b643070ba328b7711187c8","observation_id":"4d315fcc-0848-49ac-96e1-6050c8eafbb1","resolution":{"observed_at":"2026-08-06T21:37:57.279909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.263108Z","title":"The llama 4 herd: The beginning of a new era of natively multimodal ai innovation","venue":null,"work_id":"4a8e2c4c-795b-49e1-a921-6aba4c6616bb","year":2025},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:50.377890Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:b301b0fa9e10158bedcfa7262c29c9377e340bccb3fe68515b84a962759c3e2c","observation_id":"9c41d26e-68ac-488d-8c30-1c7a2a243d09","resolution":{"observed_at":"2026-08-06T21:37:57.267190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.250590Z","title":"Claude 3.5: Next-generation language models","venue":null,"work_id":"31e2a85c-df76-4e7a-8feb-e0858a62ddc5","year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:50.463981Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:2e305e7b9bcaf4ed085d7c80b5c2ffebf37df71398f6b3079f013ce532923918","observation_id":"53a705c0-6657-455f-819c-9013f35389f5","resolution":{"observed_at":"2026-08-06T21:37:57.254588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.237737Z","title":"Claude 3.7: Advancements in language understanding","venue":null,"work_id":"4312458c-fb76-4275-8f1c-89a672d96540","year":2025},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:50.507926Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:3cfb10f71e1d6921ccad882749f0d1d6aefb6dbbc1a727f20729111fde195691","observation_id":"c216f380-c155-4219-a7c5-bb70cd4309b3","resolution":{"observed_at":"2026-08-06T21:37:57.241879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.224600Z","title":null,"venue":null,"work_id":"60cfc5cf-e4ec-46ad-ace7-8da30a930f46","year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:50.590499Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:705fe73038d373311ae129d28717cb0873b140056b0dd9d32687221edfed82de","observation_id":"13d8d062-c7cf-449e-bfc8-21c54f844013","resolution":{"observed_at":"2026-08-06T21:37:57.228911Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07095","last_updated":"2025-02-26T11:57:30Z","snapshot_observed_at":"2026-08-06T21:08:58.653035Z","submitted_at":"2024-10-09T17:34:27Z","title":"MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07095","snapshot_observed_at":"2026-08-06T21:37:50.650169Z","title":"Mle-bench: Evaluating machine learning agents on machine learning engineering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:50.650169Z"},"links":{"cited_paper":"/paper/2410.07095","citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:4d3fb022b5ddfeb2333d8508ecd9c04d2fc6819aef2869b7d5ff8b9c28208aa0","observation_id":"dbeba95d-0dd7-46bf-9482-91eef5049960","resolution":{"observed_at":"2026-08-06T21:37:50.650169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-06T21:37:50.711814Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:50.711814Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:b72b0f43b8780f859521863e25ccbfa692c61c0f2e42e32c78c51d2ee23827da","observation_id":"5c594346-2d69-4e4f-a8d5-abcdcee3746b","resolution":{"observed_at":"2026-08-06T21:37:50.711814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T21:37:50.787132Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:50.787132Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:e35a8f6bf38b5f6c5607e88f31f52a3b8c900ec6758b1644966dd7ccbf83af4d","observation_id":"39c164cf-b273-49ef-92df-ad7218e1e9ff","resolution":{"observed_at":"2026-08-06T21:37:50.787132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.211969Z","title":"Laradji, Manuel Del Verme, Tom Marty, David Vazquez, Nicolas Chapados, and Alexandre Lacoste","venue":null,"work_id":"3569e0fe-f8f2-4961-89d5-b995075ea12b","year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:50.852268Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:a3ca9365819f635fbda8d55c1f92d225dc9e3610b6a2c2f47651c06351068189","observation_id":"be278e08-16aa-4dc6-8875-c0a78999081d","resolution":{"observed_at":"2026-08-06T21:37:57.215894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.197457Z","title":"Gemini 2.5: Our most intelligent ai model, 2025","venue":null,"work_id":"d684278c-34a0-4429-aa74-c4c7dbb100fe","year":2025},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:50.943251Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:fe180445aac05fffd8d27d4f0272229e9d830c3f7c81331c2f0590d38d996419","observation_id":"25d5083f-57c2-4d75-8493-b73cee719fda","resolution":{"observed_at":"2026-08-06T21:37:57.202284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T21:37:50.993213Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:50.993213Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:31f6e0bd84a59d8082cba9ceca1763185a0b97618706f2de398719cf0076294a","observation_id":"f42eff18-f0fa-41d3-80dc-ac02d16b4a38","resolution":{"observed_at":"2026-08-06T21:37:50.993213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T21:37:51.085757Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:51.085757Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:b54e2197bfa36c0941e2e9326932b1d5b5fec285c0d2b01bb37455b18bc00db0","observation_id":"6923dfeb-86cc-480d-8a21-377f4f3458b5","resolution":{"observed_at":"2026-08-06T21:37:51.085757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.181581Z","title":"Text-to-SQL in the wild: A naturally-occurring dataset based on stack exchange data","venue":null,"work_id":"fc474569-0b57-41a1-bf76-606db3f7f448","year":2021},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:51.166759Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:99e5af623e3a54e8c4439866fcfd57bacf46b763ab80539405e0536c6bbf0f3c","observation_id":"efd09a51-46ec-42ea-b264-43336721becc","resolution":{"observed_at":"2026-08-06T21:37:57.186096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.167790Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":"9e843797-9093-415e-9e54-16d196c4e129","year":2021},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:51.238203Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:8ee021c538f0f9e4d2203541f09eb72f590b6bec5ecd8544333b377a2d18314c","observation_id":"d60b1519-3c14-4765-a5db-57d57519602f","resolution":{"observed_at":"2026-08-06T21:37:57.172170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.153974Z","title":"InfiAgent-DABench: Evaluating agents on data analysis tasks","venue":null,"work_id":"2869d613-b49d-4c0e-af36-24e475d85126","year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:51.368894Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:6639ce5bf1827b6c09d2f054c92a8269bc0f936332d19f80904ea815b1c0b599","observation_id":"3e367110-4d52-4d25-adb3-e8549ba96535","resolution":{"observed_at":"2026-08-06T21:37:57.158449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.140364Z","title":"Mlagentbench: evaluating language agents on machine learning experimentation","venue":null,"work_id":"81626455-c533-46b5-ae64-81be95d407fc","year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:51.414910Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:d1530a4f9b1fdb23593bce2f22f9a36bf6ba5b651cf1f986e56d439e5dd29d97","observation_id":"1977c770-4d5b-46ae-a20c-82fba8066dfc","resolution":{"observed_at":"2026-08-06T21:37:57.144688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.121923Z","title":"DA-code: Agent data science code generation benchmark for large language models","venue":null,"work_id":"456ce991-dd63-4cef-b2b9-b3584adaf95c","year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:51.518323Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:df1383979f97e9c5f18c1b91e2fe0453d7215cb45fdb517ac9bcd36de8a289a3","observation_id":"87af90cf-60bb-4edd-87e6-13c81dee47b3","resolution":{"observed_at":"2026-08-06T21:37:57.125954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:51.577389Z","title":"Financebench: A new benchmark for financial question answering, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:51.577389Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:366e3061e3afbeccdce327f4c4e963c129d610644ea3345bd0c9f80723e84bdc","observation_id":"e6b73b48-8231-49a3-9207-fffff11dea19","resolution":{"observed_at":"2026-08-06T21:37:51.577389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:51.695010Z","title":"SWE-bench: Can language models resolve real-world github issues? In The Twelfth International Conference on Learning Representations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:51.695010Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:c6e0d04f551611edd668a590191e6646655867b1ac768bc636064f037b00ef58","observation_id":"1ffd4f8f-cb5e-426f-814c-8932093f66a5","resolution":{"observed_at":"2026-08-06T21:37:51.695010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.089113Z","title":"DSBench: How far are data science agents from becoming data science experts? In The Thirteenth International Conference on Learning Representa- tions, 2025","venue":null,"work_id":"11343a81-77dd-466c-8706-5cce9d5007c0","year":2025},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:51.782173Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:9e6e251bf20fbab16de27ad2b010d615157fd4956bd1d9f0f5a2c3d3cf60c706","observation_id":"dad541e7-06b3-471f-85c6-5da7590a891b","resolution":{"observed_at":"2026-08-06T21:37:57.093190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:51.897687Z","title":"Ds-1000: A natural and reliable benchmark for data science code generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:51.897687Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:d011ea2442a592f58a8cc40f2a866b65b0ba231f0f67fe22480a1b4ddc130dc6","observation_id":"a3da2933-c194-4152-9803-8d353273e5cd","resolution":{"observed_at":"2026-08-06T21:37:51.897687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.065642Z","title":"KaggleDBQA: Realistic eval- uation of text-to-SQL parsers","venue":null,"work_id":"cf824325-a00e-450a-ba46-ad398c912ea9","year":2021},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:51.960292Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:73e8afe08394ae79eacd572e9c0371ad38cd13c22d599df7af61a76f00cff09c","observation_id":"ccad99ba-4c64-4542-9986-c7e4cd043976","resolution":{"observed_at":"2026-08-06T21:37:57.069791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.051736Z","title":"Spider 2.0: Evaluating language models on real-world enterprise text-to-SQL workflows","venue":null,"work_id":"3dbd44af-0d51-4aae-ac3b-15ccf71772c8","year":2025},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:52.035704Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:8f8d2fc59f7ae4e714132863b7f3a5fd545acb2d8a8654b4c2278e8648d26ead","observation_id":"ad14efe0-2847-4d41-90b9-c4c0929c0bac","resolution":{"observed_at":"2026-08-06T21:37:57.056301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.037391Z","title":"Can llm already serve as a database interface? a big benchmark for large-scale database-grounded text-to-sqls","venue":null,"work_id":"a6864141-0223-4d31-9334-430e2686f418","year":2023},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:52.115929Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:829a1b1b3a54d8e0f674b6c8f33557c828aaa94933d42808065bc14a1f5c62b1","observation_id":"f69aea46-4d3c-4d41-ad35-33788897ee2f","resolution":{"observed_at":"2026-08-06T21:37:57.042324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.023517Z","title":null,"venue":null,"work_id":"d508e13f-0db2-43f9-9549-38cccefeeffd","year":2018},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:52.185268Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:c9a3cabf61e91d392d64a4f33416a3ff606a59f3cfda3735e7f43adfe1b384dd","observation_id":"88d65af3-85e1-4685-92c3-21a1cf1abceb","resolution":{"observed_at":"2026-08-06T21:37:57.027806Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T21:37:52.243377Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:52.243377Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:1e1a64eb9b2798dd6532987f9a980d8d49b977a496d1622b93e9b1029c4b9b4b","observation_id":"19c53cf2-4f48-41f8-b39f-d0811b0c152a","resolution":{"observed_at":"2026-08-06T21:37:52.243377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.009855Z","title":"Agentbench: Evaluating LLMs as agents","venue":null,"work_id":"9555e0fc-b05f-4b2a-9050-97432a366058","year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:52.323582Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:24e0aba8190067861340f66ac2e161e3415e19f1c8e69d5077785c7c4b82fcba","observation_id":"fa3a561c-799a-4c41-9755-3b739a34c96c","resolution":{"observed_at":"2026-08-06T21:37:57.013855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:56.996277Z","title":"Gaia: a benchmark for general ai assistants","venue":null,"work_id":"bf5d5d14-e999-44fc-9da9-81c4e8032870","year":2023},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:52.416043Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:defa9c4aa5b5970f48d7a69d8097ea753f83bcc04d6313476407c5eff44c6fc4","observation_id":"f6874c40-368f-4d2e-a4bf-5b036e725406","resolution":{"observed_at":"2026-08-06T21:37:57.000512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:56.982460Z","title":"GSM-symbolic: Understanding the limitations of mathematical reasoning in large language models","venue":null,"work_id":"199aa7a5-119b-436e-ae4a-275f5e90651d","year":2025},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:52.478008Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:9f5ea8c1719fae481b46c08247792d3736c3b787d23a8fb8045103a1a1ddfad6","observation_id":"4ec8070a-dae3-43fa-add3-29b17f4fa92b","resolution":{"observed_at":"2026-08-06T21:37:56.986853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:56.968555Z","title":"Introducing gpt-4o: Multimodal capabilities and efficiency","venue":null,"work_id":"3a40589f-ca47-4759-a1cd-d31e356886e6","year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:52.556221Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:629be00b2bf71e72168b8e5af2a749c1e037f3803769b270302f88840f12d4f8","observation_id":"f7bca586-d0ee-4c66-9e7c-3b1d8c93405e","resolution":{"observed_at":"2026-08-06T21:37:56.973080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:56.955711Z","title":"Gpt-4o mini: advancing cost-efficient intelligence","venue":null,"work_id":"e7fe11ef-fb99-4c74-97c7-79fcc8228a8d","year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:52.644866Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:b0230dba3c9a9ad2f80f75b0625179bd3a4ee3b0e752b0058eaed4b98e20dffb","observation_id":"78f6950f-26f5-47ab-929c-f87abf9397ac","resolution":{"observed_at":"2026-08-06T21:37:56.959752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:56.942498Z","title":"Openai o1 and new tools for developers","venue":null,"work_id":"eb8ce1df-8d82-404a-a0eb-20ab022c087a","year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:52.711930Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:71aa7446599fbac45e20aae33701df9ae8f6bf0e625359027769f62f86c93c8d","observation_id":"73e40c86-e70f-4a96-82ba-d258d2dd2bcd","resolution":{"observed_at":"2026-08-06T21:37:56.947052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:56.929276Z","title":"Gpt-4.1 technical overview","venue":null,"work_id":"10dc6061-9275-40b0-b03c-99089604aff0","year":2025},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:52.775886Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:d4d6bbcec6428574f63f44777e314f660cccdc1523599391f924723c5f651f88","observation_id":"cfc5149b-3e5c-420a-8654-26d83a5f34dc","resolution":{"observed_at":"2026-08-06T21:37:56.933192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:56.756238Z","title":"Introducing openai o3 and o4-mini","venue":null,"work_id":"ca040304-3212-4f74-b389-00be28425751","year":2025},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:52.865165Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:a18768a8631d86eb6ec1e4650cd4d386abf3871b6ef67f38ca349868735e96cc","observation_id":"517e6610-118a-4502-bf78-2fbe3128c30b","resolution":{"observed_at":"2026-08-06T21:37:56.841094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.01395","last_updated":"2019-05-04T00:27:22Z","snapshot_observed_at":"2026-07-06T07:50:18.818939Z","submitted_at":"2019-05-04T00:27:22Z","title":"On the Difficulty of Evaluating Baselines: A Study on Recommender Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.01395","snapshot_observed_at":"2026-08-06T21:37:52.935613Z","title":"On the difficulty of evaluating baselines: A study on recommender systems","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:52.935613Z"},"links":{"cited_paper":"/paper/1905.01395","citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:53f539d9365da08cbbbe414707a09f560deb90dec083ff415f3e3322b942919a","observation_id":"399e59f8-ea89-421d-b6e7-504fe3faaa0b","resolution":{"observed_at":"2026-08-06T21:37:52.935613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:56.522519Z","title":"smolagents: A smol library to build great agentic systems, 2025","venue":null,"work_id":"1e2f8e22-7836-4c08-9ac3-2587c3d382c5","year":2025},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:53.007256Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:475a7417dfaec20bde68b4b687df72e1beda86205f34a41edadb891793f70bc5","observation_id":"fd058908-c099-4d70-abbe-6dbc1cf6f90c","resolution":{"observed_at":"2026-08-06T21:37:56.721918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:56.307662Z","title":"Let me speak freely? a study on the impact of format restrictions on large language model performance","venue":null,"work_id":"ff92221e-3e47-4408-9176-0cfc16fe6652","year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:53.112099Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:2ef01e2673c59e860e9dd48e0587531bfab6a13e0196bad5d739cdbba45d35ca","observation_id":"430eae7b-a90d-4ab3-828a-8f9fa0b44d0e","resolution":{"observed_at":"2026-08-06T21:37:56.346199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:56.206485Z","title":"Attention is all you need","venue":null,"work_id":"635e85d3-b1de-476e-92c6-63debd7a2a2a","year":2017},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:53.182266Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:30ed2dafc14d1ae6e1363040d3c7cd12b0c0c28f7df8571f6b536df9dadb124d","observation_id":"224fe5b7-773b-43ce-b753-7d3f9b33d125","resolution":{"observed_at":"2026-08-06T21:37:56.272722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:56.072228Z","title":null,"venue":null,"work_id":"66b02f67-8b49-48a8-bbe8-a3c3d11b2285","year":2019},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:53.266303Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:3ee0684c478387a4d444b91dea4cb0aab93a1690332fd13ed9d8964eaf84d3c3","observation_id":"2ad18714-dea3-48c9-9525-941ad833c1ce","resolution":{"observed_at":"2026-08-06T21:37:56.144291Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:55.901331Z","title":"Text-to-sql generation for question answering on electronic medical records","venue":null,"work_id":"5e7f9e5f-d9c1-4f5b-9ac6-1cc925b67291","year":2020},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:53.317720Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:27c328e8bcd571a20f3d46822a6915ff83d528572b6b75d27704a11ec47840fb","observation_id":"9d799cd1-a372-4fb0-ab24-903b849b45f2","resolution":{"observed_at":"2026-08-06T21:37:55.993395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:55.715900Z","title":"Won- derbread: A benchmark for evaluating multimodal foundation models on business process management tasks","venue":null,"work_id":"c6811102-1bca-425b-b77d-6652d00e98b2","year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:53.399064Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:269de5b580dfc98ad63cb71546f8aa31765193b7716dd28abe448c069cf7d22c","observation_id":"44fab7f5-6366-4e6f-a27a-ae3086d26246","resolution":{"observed_at":"2026-08-06T21:37:55.792634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:55.500100Z","title":"Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments","venue":null,"work_id":"c7cb0844-811b-4a83-ba4a-ada1ecf5d95d","year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:53.476819Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:0237a9f5f7cefc47991b3e17387d83a40f4a67bf10dec45b4f737d508fd926b2","observation_id":"9b3f0674-ec5c-47d2-a125-bb7ff1a64c01","resolution":{"observed_at":"2026-08-06T21:37:55.585395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-06T21:37:53.510368Z","title":"Sorry-bench: Systematically evaluating large language model safety refusal behaviors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:53.510368Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:b64258036258bd28af13db6a79917307f4dfbe2fc21bfea8bd095aa233455432","observation_id":"1349b8da-5657-4278-9702-4815ef78a55e","resolution":{"observed_at":"2026-08-06T21:37:53.510368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:55.278565Z","title":"Intercode: Standard- izing and benchmarking interactive coding with execution feedback","venue":null,"work_id":"a797d9e1-9005-47b1-b974-41aed817b994","year":2023},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:53.621416Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:93544db323c74255d8623df991b9b303b75c8a76b81cbbfdc4b67aa57c793858","observation_id":"d2b9a81d-d68c-4d9f-8bd1-90d789826100","resolution":{"observed_at":"2026-08-06T21:37:55.392738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:53.686043Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:53.686043Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:a0d46a2d0c244e9cf960b83a534406a030e862123aa35350fe304b7079025072","observation_id":"c985aa84-40ad-4478-ac04-5495149a8b6e","resolution":{"observed_at":"2026-08-06T21:37:53.686043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:55.034926Z","title":"Natural language to code generation in interactive data science notebooks","venue":null,"work_id":"153d4e91-f5c0-43b7-be0e-dc21895a9248","year":2023},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:53.758304Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:8a78cd56015828b493f7639f67e0d196879e1368073bfd643e6587f6b2a0c5a5","observation_id":"5d723746-67cf-4626-afb7-cda7350050d1","resolution":{"observed_at":"2026-08-06T21:37:55.209547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:54.855400Z","title":"Spider: A large-scale human-labeled dataset for complex and cross-domain semantic parsing and text-to-sql task","venue":null,"work_id":"a24a128f-4528-4bc2-9d9b-dcac86d0776b","year":2018},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:53.855369Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:115a7a669b39a14d6bfcdd2e38ada199dd1d640c410d6d0dcbd04075898db7ed","observation_id":"77c023b4-86c9-4cae-9759-955d778af1a0","resolution":{"observed_at":"2026-08-06T21:37:54.982137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:54.673663Z","title":"Benchmarking data science agents","venue":null,"work_id":"f164e270-80ed-4523-8378-d4800cbcdb80","year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:53.940982Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:b72148c66d770ae899a83f0da6e4ed59110fcb9938e6717b63c6c6040b3ad80e","observation_id":"4a5446d4-801b-45d5-87c1-bca8f374a499","resolution":{"observed_at":"2026-08-06T21:37:54.784644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:54.541083Z","title":"Judging llm-as-a-judge with mt- bench and chatbot arena","venue":null,"work_id":"72db1eb4-1176-413c-a1a9-74c4ab5d37ae","year":2023},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:54.029828Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:ee8bb65f49210a2770e6705b0a3c439babbbafda02c2c37bd3518fdae5d3caea","observation_id":"ba97e827-8b90-41de-ad74-e8d97748cfce","resolution":{"observed_at":"2026-08-06T21:37:54.596063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.00103","last_updated":"2017-11-09T23:06:14Z","snapshot_observed_at":"2026-08-03T05:45:09.122112Z","submitted_at":"2017-08-31T23:12:15Z","title":"Seq2SQL: Generating Structured Queries from Natural Language using Reinforcement Learning","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.00103","snapshot_observed_at":"2026-08-06T21:37:54.118777Z","title":"Seq2sql: Generating structured queries from natural language using reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:54.118777Z"},"links":{"cited_paper":"/paper/1709.00103","citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:979414ac3614e8831abc9946f63ccaacbefcdc3e9263dfdda8c95fd7e34ae6b2","observation_id":"1a061464-ef55-4cea-8158-caa7e362e69a","resolution":{"observed_at":"2026-08-06T21:37:54.118777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:54.404843Z","title":"Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried, Uri Alon, and Graham Neubig","venue":null,"work_id":"552642d9-7861-48e3-a233-dbfd66e6fc70","year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:54.197640Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:508f235b0fd82ef89160f3db598d489617852b9f441a6eb8dfb71457c8d9bc38","observation_id":"9c3f61fc-2d65-4c4c-9e34-3b2b93ff5e2a","resolution":{"observed_at":"2026-08-06T21:37:54.462473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":35},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 20 inbound Pith citation observations for arXiv:2506.23719."}