{"as_of":"2026-08-07T07:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d145e5e4a9a8510c22f78433536334e41e4e4d9a84ee5a7b8e40e66453dbbc31","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T19:54:08.590179Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.28033/citation-record","integrity":"/paper/2607.28033/integrity","json":"/paper/2607.28033/citation-record.json","paper":"/paper/2607.28033"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:54:07.464704Z","title":"2025.Claude Code: An Agentic Coding Tool","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:07.464704Z"},"links":{"citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:ef834afa809f35e3262b0f75da914de061c28123c33e0286a84053461fad5de5","observation_id":"e1ee3544-3cf6-422a-aaa7-51dab5241a87","resolution":{"observed_at":"2026-07-31T19:54:07.464704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:54:07.546704Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:07.546704Z"},"links":{"citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:e70bd9b19c866aaf1646ea159d765637d658206262746c2dc91f9861bd229f72","observation_id":"82b51ebb-c6d6-4b2e-903e-7917d7c36772","resolution":{"observed_at":"2026-07-31T19:54:07.546704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:54:07.653884Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:07.653884Z"},"links":{"citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:31b0b22b93a794dfdd61c39de5b7915ee30c11cb99ef2ec20fb83249bb758fc5","observation_id":"d1905624-988c-4fdd-a3df-901a900542d1","resolution":{"observed_at":"2026-07-31T19:54:07.653884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:54:07.733235Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:07.733235Z"},"links":{"citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:223c936068d2590b040b0f387b5d691cf772766468778434c44b2ff38eaba3eb","observation_id":"b8bb039e-38d3-4874-aad7-1e859d7c2446","resolution":{"observed_at":"2026-07-31T19:54:07.733235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-07-31T19:54:07.872381Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:07.872381Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:beb0ac976e443b33681ed1b01f3d454c4c605b94cbeea87fc7f6707a1a5eb7f5","observation_id":"0fef3aa3-8e6f-4b5f-9e19-5988d8eaca27","resolution":{"observed_at":"2026-07-31T19:54:07.872381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:54:08.036540Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.036540Z"},"links":{"citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:a23568918f0b7fc8236cb3c4b0f95b1c2140b704fa3cecfc14605965b8a59ee0","observation_id":"7f671eb6-ee82-48da-a0c0-b19ac6eca6b6","resolution":{"observed_at":"2026-07-31T19:54:08.036540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.10912","last_updated":"2026-05-11T17:49:43Z","snapshot_observed_at":"2026-08-03T00:15:01.823825Z","submitted_at":"2026-05-11T17:49:43Z","title":"WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.10912","snapshot_observed_at":"2026-07-31T19:54:08.200975Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.200975Z"},"links":{"cited_paper":"/paper/2605.10912","citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:23988bc28ada948e3507e3a8f318b5bac6847f81f45f7e999ec1ee40ec0bd8e9","observation_id":"586e314b-b762-424d-b5d8-bd7a6ce4b215","resolution":{"observed_at":"2026-07-31T19:54:08.200975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-06T21:30:55.221402Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-07-31T19:54:08.368823Z","title":"Kingma, Leandro von Werra, and Thomas Wolf","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.368823Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:8202b664a6293d5dd1c3cb0e6cf98a4579cb6944934412b998baf9f4102f5962","observation_id":"2b6306c8-17af-4a00-bd30-9d2331ff07a6","resolution":{"observed_at":"2026-07-31T19:54:08.368823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-07-31T19:54:08.424746Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.424746Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:f915a99404bc83f34b0fd0cd1e9fbe5147bc60f19cc39f5cebcde56b49931d7c","observation_id":"cc7f1967-15e2-4ca2-9102-a5c77471b5d3","resolution":{"observed_at":"2026-07-31T19:54:08.424746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.26752","last_updated":"2026-05-12T15:07:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-29T14:49:37Z","title":"GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.26752","snapshot_observed_at":"2026-07-31T19:54:08.429432Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.429432Z"},"links":{"cited_paper":"/paper/2604.26752","citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:fb9044126a360413c281e79d28d27dcbaa011a0bc05129ff25edc69c8dbc2927","observation_id":"1b7798bc-7e88-48d5-b255-6f7969674115","resolution":{"observed_at":"2026-07-31T19:54:08.429432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:54:08.434369Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.434369Z"},"links":{"citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:2bccc0541b88dffc5d4b58077fa47f3e1017fcc06db5dd470f0f7ac45f7d9124","observation_id":"96b56ec2-9993-47c0-836e-c3d0354c4f7e","resolution":{"observed_at":"2026-07-31T19:54:08.434369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:54:08.438537Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.438537Z"},"links":{"citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:637d8d28dfd52840c89a700e10e3671c72232ba180e606d7f9d256bb81eaf6e3","observation_id":"4d767a33-b658-40aa-a247-2492f12bfd04","resolution":{"observed_at":"2026-07-31T19:54:08.438537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:54:08.442926Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.442926Z"},"links":{"citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:f74a3875288df75a1163fb42fd0d2f75612fd20de59ffa8caf14e621848f7db3","observation_id":"c0a89012-0e3a-4779-9c04-69a4804e7c70","resolution":{"observed_at":"2026-07-31T19:54:08.442926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:54:08.447054Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.447054Z"},"links":{"citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:37e975bfb5330f2450b7d30977c56d275a17267c31ca8c29a82271a1ceaf3ecf","observation_id":"8d4f3431-3730-4fc0-9e02-153e04c1c95c","resolution":{"observed_at":"2026-07-31T19:54:08.447054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11944","last_updated":"2023-11-20T17:28:02Z","snapshot_observed_at":"2026-07-06T16:50:06.095609Z","submitted_at":"2023-11-20T17:28:02Z","title":"FinanceBench: A New Benchmark for Financial Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11944","snapshot_observed_at":"2026-07-31T19:54:08.451269Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.451269Z"},"links":{"cited_paper":"/paper/2311.11944","citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:02b8b9c99063e966632a478caca382ec97b2cc0262004cf985b26561dee707bf","observation_id":"b81538a5-d210-4ce4-9d54-f1b5517b1997","resolution":{"observed_at":"2026-07-31T19:54:08.451269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04808","last_updated":"2025-04-14T19:46:56Z","snapshot_observed_at":"2026-07-06T21:05:15.750647Z","submitted_at":"2025-04-07T08:03:36Z","title":"ELT-Bench: An End-to-End Benchmark for Evaluating AI Agents on ELT Pipelines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04808","snapshot_observed_at":"2026-07-31T19:54:08.455823Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.455823Z"},"links":{"cited_paper":"/paper/2504.04808","citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:962c3fee9eac8071259aa6e759d6fd97b30c611cb32cb89b5afd68cc4ab2e3cc","observation_id":"78a16ad9-3e05-41eb-9190-00f1664a844e","resolution":{"observed_at":"2026-07-31T19:54:08.455823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-07-31T19:54:08.460216Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.460216Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:51563d5e1fe44d73fb206e06d9d50dc1092567e48be45cdd5418ede89a199890","observation_id":"d5617336-597e-4526-9ee6-f7bab0feb53b","resolution":{"observed_at":"2026-07-31T19:54:08.460216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11501","last_updated":"2022-11-18T17:20:27Z","snapshot_observed_at":"2026-08-06T17:51:02.914236Z","submitted_at":"2022-11-18T17:20:27Z","title":"DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11501","snapshot_observed_at":"2026-07-31T19:54:08.464457Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.464457Z"},"links":{"cited_paper":"/paper/2211.11501","citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:1d10792b1368c04a66a5f035de81cff1d4eb7b1b08415c9cf5496e329c76cd14","observation_id":"0a012d1b-edcd-4d54-9df8-89d2170e8017","resolution":{"observed_at":"2026-07-31T19:54:08.464457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:54:08.469328Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.469328Z"},"links":{"citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:8dc5a226d55f3fe160893e447e14fea875a6e5d1a49f026dd136f993db84ed53","observation_id":"996938e0-cb8f-4489-8df8-66cbd9e700c3","resolution":{"observed_at":"2026-07-31T19:54:08.469328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03111","last_updated":"2023-11-15T04:56:25Z","snapshot_observed_at":"2026-07-06T15:23:29.240615Z","submitted_at":"2023-05-04T19:02:29Z","title":"Can LLM Already Serve as A Database Interface? A BIg Bench for Large-Scale Database Grounded Text-to-SQLs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03111","snapshot_observed_at":"2026-07-31T19:54:08.473423Z","title":"Chang, Fei Huang, Reynold Cheng, and Yongbin Li","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.473423Z"},"links":{"cited_paper":"/paper/2305.03111","citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:0e1471ce21c093468ef0217b917722660d6902d4797b8d3cf1ee388d8cf33d6f","observation_id":"561ba190-73de-48dd-9104-52a735b1f8e6","resolution":{"observed_at":"2026-07-31T19:54:08.473423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:54:08.477956Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.477956Z"},"links":{"citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:d53632c63f94e45fa54928ff0fb1bec95e4e9d13d313662f76c26c9974bacc9a","observation_id":"79c89d99-67be-49f0-b813-f9187972d75c","resolution":{"observed_at":"2026-07-31T19:54:08.477956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03688","last_updated":"2025-10-04T03:54:18Z","snapshot_observed_at":"2026-08-06T20:36:41.418114Z","submitted_at":"2023-08-07T16:08:11Z","title":"AgentBench: Evaluating LLMs as Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03688","snapshot_observed_at":"2026-07-31T19:54:08.487404Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.487404Z"},"links":{"cited_paper":"/paper/2308.03688","citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:5da725176e423e3e32c7494603c060028ae0a6780a416c8b048e87cf5cd29ec4","observation_id":"044cd016-14aa-4c6c-b2d7-0e62277acb76","resolution":{"observed_at":"2026-07-31T19:54:08.487404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:54:08.491484Z","title":"McKeeman","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.491484Z"},"links":{"citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:1a0516fc02a1c42489e171b97e2cc9312674cf688156bc1973dbd67ff8bd9e70","observation_id":"0e3e9838-af39-45d0-8d31-80b35e438d76","resolution":{"observed_at":"2026-07-31T19:54:08.491484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.26494","last_updated":"2026-07-30T05:04:36Z","snapshot_observed_at":"2026-08-06T03:12:19.331370Z","submitted_at":"2026-05-26T03:16:11Z","title":"The MiniMax-M2 Series: Mini Activations Unleashing Max Real-World Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.26494","snapshot_observed_at":"2026-07-31T19:54:08.495514Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.495514Z"},"links":{"cited_paper":"/paper/2605.26494","citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:16ad59ee16a56578165800e700805bf7de1d64d4246eff52130df9561e5f60f0","observation_id":"a410feff-cd3e-4a6e-93f1-ddb03dec35a5","resolution":{"observed_at":"2026-07-31T19:54:08.495514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:54:08.499804Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.499804Z"},"links":{"citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:9f3f344e267bd86b309a42d88f5bef0b8a1fd2b04efb32c30b1920d4cf86c0ac","observation_id":"823a1da3-cc0a-4dc8-aca9-c7a507d7ba54","resolution":{"observed_at":"2026-07-31T19:54:08.499804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:54:08.504209Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.504209Z"},"links":{"citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:7546cbd97fcfe3f1be96121d0ad2fda938828206697a9ea2911abe9a4dbb4beb","observation_id":"b7cdd8dd-af68-42af-9bd1-26a17b069796","resolution":{"observed_at":"2026-07-31T19:54:08.504209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:54:08.508322Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.508322Z"},"links":{"citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:721b3f646f4274298507360386bb87cffc6e19defd2ea557d84f560b39e10373","observation_id":"e7ff8bb6-690d-47bf-b972-a4a0ac6af1be","resolution":{"observed_at":"2026-07-31T19:54:08.508322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:54:08.512415Z","title":"2025.MySQL: The World’s Most Popular Open Source Database","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.512415Z"},"links":{"citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:452e240f8c8b6b8ea55a3e3401d2306ad8538b97586d38e1a315bfca5f452f1a","observation_id":"84e7f823-fdec-4f28-885f-2d6bd97d3494","resolution":{"observed_at":"2026-07-31T19:54:08.512415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:54:08.516831Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.516831Z"},"links":{"citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:44a36ae9bf63cefe46b72e6e276d9b61f1324a851b2fc0c67d5165f69ee0dffe","observation_id":"4380eb6a-6615-4e01-9094-900b3d89db35","resolution":{"observed_at":"2026-07-31T19:54:08.516831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:54:08.526050Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.526050Z"},"links":{"citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:aef1ef4f0bb4b92853d2358232b7b4f4d6dc159846b7a4552876655217308c3e","observation_id":"b49c1138-a146-48c6-8a93-26336ec44999","resolution":{"observed_at":"2026-07-31T19:54:08.526050Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16789","last_updated":"2023-10-03T14:45:48Z","snapshot_observed_at":"2026-07-06T16:00:46.542753Z","submitted_at":"2023-07-31T15:56:53Z","title":"ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16789","snapshot_observed_at":"2026-07-31T19:54:08.521261Z","title":"InInternational Conference on Learning Representations (ICLR)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.521261Z"},"links":{"cited_paper":"/paper/2307.16789","citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:82da9f1d138a92637012b56ef052677410f7684ccaf11129c3b40e373e979762","observation_id":"a61af432-811c-460f-a87b-e5209a090bc3","resolution":{"observed_at":"2026-07-31T19:54:08.521261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:54:08.534027Z","title":"2025.CodeBuddy: An Agentic Coding and Development Platform","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.534027Z"},"links":{"citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:925c7aeb68e1ec9f3179465f19fa8f88bbec4f1d062cd0e906f4f5b879780379","observation_id":"5ee2421c-3796-488a-a1e9-805ebdfa1c7c","resolution":{"observed_at":"2026-07-31T19:54:08.534027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:54:08.530105Z","title":"2025.OpenClaw: Open-Source Personal AI Assistant","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.530105Z"},"links":{"citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:7aa3a490541162fbb2e86480852660882d1fd27df237d53d85e3e2a4e5590b1f","observation_id":"6c085e00-6227-4583-bcb6-dc814b339c2b","resolution":{"observed_at":"2026-07-31T19:54:08.530105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:54:08.542503Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.542503Z"},"links":{"citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:851ffdc3b3eb9337f81c7029ce1b70e7a8ea767d3ec03f6a437003e9daadc276","observation_id":"dde50c52-1f5d-4dd6-8b0a-a22f35c208b9","resolution":{"observed_at":"2026-07-31T19:54:08.542503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:54:08.538496Z","title":"2026.Hy3: A 295B Mixture-of-Experts Large Language Model","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.538496Z"},"links":{"citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:86630563d822358ed150192fd60a7fb89d8aab68b27dde25872c9cc136319399","observation_id":"23568056-e6fb-407d-bd74-c4ae4cb7e456","resolution":{"observed_at":"2026-07-31T19:54:08.538496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:54:08.551294Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.551294Z"},"links":{"citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:bb09f7a8079fd9e4363ea602c2043f5a2c52fb4ac1b76f48085b2a0450c3e9b4","observation_id":"97e60f84-29d8-4014-8e9b-4080cb8f63f0","resolution":{"observed_at":"2026-07-31T19:54:08.551294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10691","last_updated":"2024-03-12T15:53:06Z","snapshot_observed_at":"2026-08-04T02:23:17.954207Z","submitted_at":"2023-09-19T15:25:42Z","title":"MINT: Evaluating LLMs in Multi-turn Interaction with Tools and Language Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10691","snapshot_observed_at":"2026-07-31T19:54:08.546745Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.546745Z"},"links":{"cited_paper":"/paper/2309.10691","citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:1e4c9254143fb8c22f4fa075f21de7a9e57ea15193896ba067a7e2c829d2761d","observation_id":"7761b0a8-c03b-43d6-9ee7-f924f4de7fff","resolution":{"observed_at":"2026-07-31T19:54:08.546745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:54:08.568668Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.568668Z"},"links":{"citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:5be2f1ab5a425df4c9c34b1b8d2788facadc6c100c2f449ef7cac4fda7670497","observation_id":"77344f6c-a682-4c13-957d-39b1ee49ab95","resolution":{"observed_at":"2026-07-31T19:54:08.568668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:54:08.577411Z","title":"Franklin, Scott Shenker, and Ion Stoica","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.577411Z"},"links":{"citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:5221bd593fa6ce9ef49be3234f381c9051b528667b8e348efd2167d4019d00f1","observation_id":"9421e6f7-af1f-4eab-917b-2e70ee7eec38","resolution":{"observed_at":"2026-07-31T19:54:08.577411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:54:08.559597Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.559597Z"},"links":{"citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:f36c3c320628405156f72b7f224fa4cb67d79915aea126bd81fd25e30cc918bc","observation_id":"9f88b284-d8a9-4423-a3e1-426e44f5d2eb","resolution":{"observed_at":"2026-07-31T19:54:08.559597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.06132","last_updated":"2026-05-07T14:06:23Z","snapshot_observed_at":"2026-07-06T22:54:40.349479Z","submitted_at":"2026-04-07T17:43:18Z","title":"Claw-Eval: Towards Trustworthy Evaluation of Autonomous Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.06132","snapshot_observed_at":"2026-07-31T19:54:08.564257Z","title":"arXiv:2604.06132 doi:10.48550/arXiv.2604.06132","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.564257Z"},"links":{"cited_paper":"/paper/2604.06132","citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:543176505c9f797625ca7aeb4dbb6c730bd7b2f61156778a6a75816fac0b3a9c","observation_id":"6e0c004d-3eaf-40f8-b00b-b45f3dd57776","resolution":{"observed_at":"2026-07-31T19:54:08.564257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.00103","last_updated":"2017-11-09T23:06:14Z","snapshot_observed_at":"2026-08-03T05:45:09.122112Z","submitted_at":"2017-08-31T23:12:15Z","title":"Seq2SQL: Generating Structured Queries from Natural Language using Reinforcement Learning","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.00103","snapshot_observed_at":"2026-07-31T19:54:08.590179Z","title":"Low-score","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.590179Z"},"links":{"cited_paper":"/paper/1709.00103","citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:986b48ef4bd2f2f950d0aa43025bd50c8785adaf3bec2ade06224678e4cee420","observation_id":"e3c6fd39-7930-45a7-8f9a-6c06f60fa799","resolution":{"observed_at":"2026-07-31T19:54:08.590179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02503","last_updated":"2026-05-27T09:45:47Z","snapshot_observed_at":"2026-08-02T19:40:05.951592Z","submitted_at":"2026-05-04T11:57:09Z","title":"DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis","version":3},"cited_work":{"arxiv_id":"2605.02503","doi":"10.48550/arxiv.2605.02503","metadata_source":"pith","pith_arxiv_id":"2605.02503","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis","venue":"cs.AI","work_id":"ddc1d9a5-39c4-4ec8-885b-b6c57255bfe1","year":2026},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.581414Z"},"links":{"cited_paper":"/paper/2605.02503","citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:aa62aad22903af70177835895b6d551779b987cc89e596c77ba7860dfdb9c001","observation_id":"16fbe94d-6834-4913-8516-dd41752bc829","resolution":{"observed_at":"2026-07-31T19:56:36.534906Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-07-31T19:54:08.585942Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.585942Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:fc96aa289ec193482a42d94e69347cf7442acb8c66d0440145ff65ca37e15d54","observation_id":"44ae7661-98e1-42cb-b5c3-e448c9103f04","resolution":{"observed_at":"2026-07-31T19:54:08.585942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:54:08.573290Z","title":"InConference on Empirical Methods in Natural Language Processing (EMNLP)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.573290Z"},"links":{"citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:e7fa0b1491327391b67344412efbeafcd37eac5f32208009f14f7953642aff22","observation_id":"6a461094-46fe-4d13-8da3-e2a438eb5255","resolution":{"observed_at":"2026-07-31T19:54:08.573290Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05470","last_updated":"2023-12-07T08:48:36Z","snapshot_observed_at":"2026-08-06T02:25:36.517255Z","submitted_at":"2023-10-09T07:27:15Z","title":"Generative Judge for Evaluating Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05470","snapshot_observed_at":"2026-07-31T19:54:08.482280Z","title":"InInternational Conference on Learning Representations (ICLR)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.482280Z"},"links":{"cited_paper":"/paper/2310.05470","citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:c3b14c0ac66d2dd12bf2eb2457ba6402332dbe3828c5524e1ca09ea3729b7982","observation_id":"05eaa234-5e67-4680-bf4c-949737e83b25","resolution":{"observed_at":"2026-07-31T19:54:08.482280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02473","last_updated":"2026-05-29T10:01:49Z","snapshot_observed_at":"2026-08-05T11:38:45.770038Z","submitted_at":"2025-09-02T16:25:12Z","title":"FDABench: A Benchmark for Data Agents on Analytical Queries over Heterogeneous Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02473","snapshot_observed_at":"2026-07-31T19:54:08.555375Z","title":"InACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.555375Z"},"links":{"cited_paper":"/paper/2509.02473","citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:f5d8e5b091a59fe62dab98f9b610b8b5016a3f5b976af2136d46e6980d7ddc9f","observation_id":"88bfc34a-aa45-4250-b1f7-d452d5cfdc00","resolution":{"observed_at":"2026-07-31T19:54:08.555375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2607.28033."}