{"as_of":"2026-08-17T16:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8dd5ddebdb5d32c6c631fe139a20aef59787bce919ae3bb58b1e9b7e7becafc9","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:36:02.687612Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.20911/citation-record","integrity":"/paper/2607.20911/integrity","json":"/paper/2607.20911/citation-record.json","paper":"/paper/2607.20911"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-08-12T14:56:35.025839Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-15T15:36:02.595063Z","title":"Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik Narasimhan","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20911","last_updated":"2026-07-23T04:34:06Z","snapshot_observed_at":"2026-08-17T12:37:24.554486Z","submitted_at":"2026-07-23T04:34:06Z","title":"Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:02.595063Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2607.20911"},"observation_digest":"sha256:ad6ae0928475a4fae967d559fecc1a6acc17e7d53c87c4fe8ae7d99bffd02e12","observation_id":"4b6516c9-2241-4dd7-ad8d-9024af362ed3","resolution":{"observed_at":"2026-08-15T15:36:02.595063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:36:03.136955Z","title":"Introducing SWE-bench verified","venue":null,"work_id":"bee1c365-1070-464a-9372-07a3526381f7","year":2024},"citing_paper":{"arxiv_id":"2607.20911","last_updated":"2026-07-23T04:34:06Z","snapshot_observed_at":"2026-08-17T12:37:24.554486Z","submitted_at":"2026-07-23T04:34:06Z","title":"Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:02.599654Z"},"links":{"citing_paper":"/paper/2607.20911"},"observation_digest":"sha256:33618d163b8ec6f55bb3a6b729bd884e39afe4e7c441e54c60ff0a4e79d14946","observation_id":"650f846d-4b37-4b51-a235-a9645a146205","resolution":{"observed_at":"2026-08-15T15:36:03.140598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03163","last_updated":"2025-02-09T04:22:26Z","snapshot_observed_at":"2026-08-16T14:12:33.804927Z","submitted_at":"2024-03-05T17:56:27Z","title":"Design2Code: Benchmarking Multimodal Code Generation for Automated Front-End Engineering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03163","snapshot_observed_at":"2026-08-15T15:36:02.603024Z","title":"Design2code: How far are we from automating front-end engineering? InProceedings of the Association for Computational Linguistics (ACL), 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20911","last_updated":"2026-07-23T04:34:06Z","snapshot_observed_at":"2026-08-17T12:37:24.554486Z","submitted_at":"2026-07-23T04:34:06Z","title":"Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:02.603024Z"},"links":{"cited_paper":"/paper/2403.03163","citing_paper":"/paper/2607.20911"},"observation_digest":"sha256:ebe1451543321cf85fc1d615e249d87407593f149147d18ccc96d75651d8564a","observation_id":"6c6ba681-e33a-4809-b64f-156ad88b51bc","resolution":{"observed_at":"2026-08-15T15:36:02.603024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13854","last_updated":"2024-04-16T15:13:18Z","snapshot_observed_at":"2026-08-14T11:14:55.351653Z","submitted_at":"2023-07-25T22:59:32Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13854","snapshot_observed_at":"2026-08-15T15:36:02.607537Z","title":"Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried, Uri Alon, and Graham Neubig","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20911","last_updated":"2026-07-23T04:34:06Z","snapshot_observed_at":"2026-08-17T12:37:24.554486Z","submitted_at":"2026-07-23T04:34:06Z","title":"Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:02.607537Z"},"links":{"cited_paper":"/paper/2307.13854","citing_paper":"/paper/2607.20911"},"observation_digest":"sha256:ed57488f5e5477f736b4c37220016f9c51ee38d18b34f7b11f0e1c8a83e2e17b","observation_id":"fa691d00-fcf7-46ec-874d-4f770eddab61","resolution":{"observed_at":"2026-08-15T15:36:02.607537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:36:03.125978Z","title":"How we compare model quality in Cursor","venue":null,"work_id":"c5fd03a8-89ae-48f2-854d-1935b1175e1c","year":2026},"citing_paper":{"arxiv_id":"2607.20911","last_updated":"2026-07-23T04:34:06Z","snapshot_observed_at":"2026-08-17T12:37:24.554486Z","submitted_at":"2026-07-23T04:34:06Z","title":"Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:02.611617Z"},"links":{"citing_paper":"/paper/2607.20911"},"observation_digest":"sha256:0a4099c63fc05df5fa83a418e38d03642e650f1d315377f4b36aeb11a47eacad","observation_id":"bb23a183-e6f0-4462-ac72-bd3fb0a7bb06","resolution":{"observed_at":"2026-08-15T15:36:03.129434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:36:02.615447Z","title":"Harbor: A framework for evaluating and optimizing agents and models in container environments","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20911","last_updated":"2026-07-23T04:34:06Z","snapshot_observed_at":"2026-08-17T12:37:24.554486Z","submitted_at":"2026-07-23T04:34:06Z","title":"Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:02.615447Z"},"links":{"citing_paper":"/paper/2607.20911"},"observation_digest":"sha256:b0f71fb3ee8a2948b65855d92b57c2915af70fa6e6691868969ff86012ea2ee9","observation_id":"406da3f5-0052-4ebe-8d4f-43c552b4f8c0","resolution":{"observed_at":"2026-08-15T15:36:02.615447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01769","last_updated":"2024-12-02T18:11:30Z","snapshot_observed_at":"2026-08-16T13:00:36.641418Z","submitted_at":"2024-12-02T18:11:30Z","title":"Commit0: Library Generation from Scratch","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01769","snapshot_observed_at":"2026-08-15T15:36:02.619120Z","title":"Chiu, Claire Cardie, Matthias Gallé, and Alexander M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20911","last_updated":"2026-07-23T04:34:06Z","snapshot_observed_at":"2026-08-17T12:37:24.554486Z","submitted_at":"2026-07-23T04:34:06Z","title":"Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:02.619120Z"},"links":{"cited_paper":"/paper/2412.01769","citing_paper":"/paper/2607.20911"},"observation_digest":"sha256:f8414d8e2abc72a44fa9f7d01cc07eb3c54c0e6c61c48f4f5cd2f2749ac89dd1","observation_id":"1c4d42de-a987-4681-a33d-05815eb392e9","resolution":{"observed_at":"2026-08-15T15:36:02.619120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-16T07:05:57.323612Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-15T15:36:02.623468Z","title":"LiveCodeBench: Holistic and contami- nation free evaluation of large language models for code, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20911","last_updated":"2026-07-23T04:34:06Z","snapshot_observed_at":"2026-08-17T12:37:24.554486Z","submitted_at":"2026-07-23T04:34:06Z","title":"Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:02.623468Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2607.20911"},"observation_digest":"sha256:30bb5cf170ce4f44ef7afd6a1274b23c841483faa447ad71cc2a90d04f2c76b1","observation_id":"53b43127-8028-46a7-9eed-18e299593ff0","resolution":{"observed_at":"2026-08-15T15:36:02.623468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03091","last_updated":"2023-10-04T01:13:49Z","snapshot_observed_at":"2026-08-13T16:44:59.404632Z","submitted_at":"2023-06-05T17:59:41Z","title":"RepoBench: Benchmarking Repository-Level Code Auto-Completion Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03091","snapshot_observed_at":"2026-08-15T15:36:02.627067Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20911","last_updated":"2026-07-23T04:34:06Z","snapshot_observed_at":"2026-08-17T12:37:24.554486Z","submitted_at":"2026-07-23T04:34:06Z","title":"Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:02.627067Z"},"links":{"cited_paper":"/paper/2306.03091","citing_paper":"/paper/2607.20911"},"observation_digest":"sha256:ff2fb1e94585005854c988d6dbd11bc5a8f40e062706ee73a3dd5cbcc5a0e673","observation_id":"af780340-34d9-4dc1-bd71-02dea49c4db1","resolution":{"observed_at":"2026-08-15T15:36:02.627067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:36:03.114461Z","title":"Aider polyglot benchmark","venue":null,"work_id":"710ab835-5757-42fa-a6bc-ac7d8758dc01","year":2024},"citing_paper":{"arxiv_id":"2607.20911","last_updated":"2026-07-23T04:34:06Z","snapshot_observed_at":"2026-08-17T12:37:24.554486Z","submitted_at":"2026-07-23T04:34:06Z","title":"Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:02.630625Z"},"links":{"citing_paper":"/paper/2607.20911"},"observation_digest":"sha256:aeb80f31bfe245f4ee153e1e2c93f518d6c8ce1ea94e562cc57a9e256440178e","observation_id":"9253df45-1629-43e1-81a3-21d46acd79e2","resolution":{"observed_at":"2026-08-15T15:36:03.117955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:36:03.102861Z","title":"Terminal-bench: A benchmark for ai agents in terminal environ- ments","venue":null,"work_id":"5b839fcc-f4f1-4cf3-8810-70915ce636a9","year":2024},"citing_paper":{"arxiv_id":"2607.20911","last_updated":"2026-07-23T04:34:06Z","snapshot_observed_at":"2026-08-17T12:37:24.554486Z","submitted_at":"2026-07-23T04:34:06Z","title":"Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:02.634631Z"},"links":{"citing_paper":"/paper/2607.20911"},"observation_digest":"sha256:76786436c2d787a85fdd9f3f0cadb01d9a7fa0f03fff3183649ec0da316520bf","observation_id":"54fbd8e2-e65f-433b-b9f8-241fc400176d","resolution":{"observed_at":"2026-08-15T15:36:03.106693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:36:02.638718Z","title":"Vibe Code Bench: Evaluating AI models on end-to-end web application development","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20911","last_updated":"2026-07-23T04:34:06Z","snapshot_observed_at":"2026-08-17T12:37:24.554486Z","submitted_at":"2026-07-23T04:34:06Z","title":"Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:02.638718Z"},"links":{"citing_paper":"/paper/2607.20911"},"observation_digest":"sha256:84ed82dacb8020c6df590666397c5c0ba3d0123d2bc1003b654ce412cc24278f","observation_id":"d9c0d408-5be4-42c8-8c2e-c806aedab33a","resolution":{"observed_at":"2026-08-15T15:36:02.638718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:36:02.642322Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20911","last_updated":"2026-07-23T04:34:06Z","snapshot_observed_at":"2026-08-17T12:37:24.554486Z","submitted_at":"2026-07-23T04:34:06Z","title":"Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:02.642322Z"},"links":{"citing_paper":"/paper/2607.20911"},"observation_digest":"sha256:196057fce7244118442563b5fb9ab42f590444587b2bcdf0db163f88f8aa944a","observation_id":"f9c2460f-fe8b-4e76-94a8-78aefe0da60c","resolution":{"observed_at":"2026-08-15T15:36:02.642322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-16T02:15:14.732809Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13832","snapshot_observed_at":"2026-08-15T15:36:02.645495Z","title":"FrontendBench: A benchmark for evaluating llms on front-end development via automatic evaluation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20911","last_updated":"2026-07-23T04:34:06Z","snapshot_observed_at":"2026-08-17T12:37:24.554486Z","submitted_at":"2026-07-23T04:34:06Z","title":"Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:02.645495Z"},"links":{"cited_paper":"/paper/2506.13832","citing_paper":"/paper/2607.20911"},"observation_digest":"sha256:c0eeea9454dac6e67a4da0ed036f1764e5b73da4e71f193aeaeb1adf52fe2d85","observation_id":"486503ac-cb80-48c5-997b-d6488756e01f","resolution":{"observed_at":"2026-08-15T15:36:02.645495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13649","last_updated":"2024-06-06T02:01:09Z","snapshot_observed_at":"2026-08-15T00:56:43.641640Z","submitted_at":"2024-01-24T18:35:21Z","title":"VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13649","snapshot_observed_at":"2026-08-15T15:36:02.648855Z","title":"VisualWebArena: Eval- uating multimodal agents on realistic visual web tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20911","last_updated":"2026-07-23T04:34:06Z","snapshot_observed_at":"2026-08-17T12:37:24.554486Z","submitted_at":"2026-07-23T04:34:06Z","title":"Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:02.648855Z"},"links":{"cited_paper":"/paper/2401.13649","citing_paper":"/paper/2607.20911"},"observation_digest":"sha256:ed6775d8cec0213ac4b752252f407365d1c41a6cc315c125f89794d68bc28733","observation_id":"220a86e3-00de-491c-af06-d2f0da5a29a7","resolution":{"observed_at":"2026-08-15T15:36:02.648855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03596","last_updated":"2026-05-14T13:14:02Z","snapshot_observed_at":"2026-08-11T09:15:17.062389Z","submitted_at":"2026-05-05T10:17:06Z","title":"Workspace-Bench 1.0: Benchmarking AI Agents on Workspace Tasks with Large-Scale File Dependencies","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.03596","snapshot_observed_at":"2026-08-15T15:36:02.653126Z","title":"Workspace-Bench 1.0: Benchmarking AI agents on workspace tasks with large- scale file dependencies, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20911","last_updated":"2026-07-23T04:34:06Z","snapshot_observed_at":"2026-08-17T12:37:24.554486Z","submitted_at":"2026-07-23T04:34:06Z","title":"Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:02.653126Z"},"links":{"cited_paper":"/paper/2605.03596","citing_paper":"/paper/2607.20911"},"observation_digest":"sha256:59d90f25de02dc7e5dadc5e53cc7416fbeaed776e22cfd540b12c7cb0c23bf4b","observation_id":"48816bfd-db39-4be8-9079-d9dd24e348bc","resolution":{"observed_at":"2026-08-15T15:36:02.653126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.05172","last_updated":"2026-04-08T09:27:21Z","snapshot_observed_at":"2026-08-14T19:24:50.886058Z","submitted_at":"2026-04-06T21:09:06Z","title":"ClawsBench: Evaluating Capability and Safety of LLM Productivity Agents in Simulated Workspaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.05172","snapshot_observed_at":"2026-08-15T15:36:02.657755Z","title":"ClawsBench: Evaluating capability and safety of LLM produc- tivity agents in simulated workspaces, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20911","last_updated":"2026-07-23T04:34:06Z","snapshot_observed_at":"2026-08-17T12:37:24.554486Z","submitted_at":"2026-07-23T04:34:06Z","title":"Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:02.657755Z"},"links":{"cited_paper":"/paper/2604.05172","citing_paper":"/paper/2607.20911"},"observation_digest":"sha256:981e6b522e2fd0b96b35c3c44c01be301d47cd15fb441a606d3b3f3cdb8c1bd7","observation_id":"7354a6cc-f6ba-4479-98e6-f46bec310083","resolution":{"observed_at":"2026-08-15T15:36:02.657755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-08-06T17:04:47.204008Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-08-15T15:36:02.661415Z","title":"OdysseyBench: Evaluating LLM agents on long-horizon complex office application workflows, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20911","last_updated":"2026-07-23T04:34:06Z","snapshot_observed_at":"2026-08-17T12:37:24.554486Z","submitted_at":"2026-07-23T04:34:06Z","title":"Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:02.661415Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2607.20911"},"observation_digest":"sha256:6dafa68272d69a40065c5d2bf03185a9f3f4e8e12fb34eb4d036a66f97f5f2fb","observation_id":"ab5bce11-45c1-4c3c-bf0e-d09550334045","resolution":{"observed_at":"2026-08-15T15:36:02.661415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:36:03.091913Z","title":"SpreadsheetBench 2: Evaluating agents on end-to-end business spreadsheet workflows, 2026","venue":null,"work_id":"1e549d1a-5cb2-44cb-8e86-9bd475280aa5","year":2026},"citing_paper":{"arxiv_id":"2607.20911","last_updated":"2026-07-23T04:34:06Z","snapshot_observed_at":"2026-08-17T12:37:24.554486Z","submitted_at":"2026-07-23T04:34:06Z","title":"Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:02.665405Z"},"links":{"citing_paper":"/paper/2607.20911"},"observation_digest":"sha256:70fd02204e0651dbb7e73de4a3be8c2e5f535055512e74c5eb3c003a1eaff69a","observation_id":"757db498-8eef-4455-a0c0-234e7c9f69af","resolution":{"observed_at":"2026-08-15T15:36:03.095635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-16T13:26:12.007650Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-15T15:36:02.669356Z","title":"Zhang, Neil Perry, Riya Dulepet, Joey Ji, Celeste Menders, Justin W","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20911","last_updated":"2026-07-23T04:34:06Z","snapshot_observed_at":"2026-08-17T12:37:24.554486Z","submitted_at":"2026-07-23T04:34:06Z","title":"Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:02.669356Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2607.20911"},"observation_digest":"sha256:70989d4410bbaf10c0c352a3a674e3d7264821229457b20775a619d38959dc2f","observation_id":"365145fe-aa15-4a18-8967-cceae3af76e2","resolution":{"observed_at":"2026-08-15T15:36:02.669356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05590","last_updated":"2025-02-18T12:26:33Z","snapshot_observed_at":"2026-08-16T20:14:18.570887Z","submitted_at":"2024-06-08T22:21:42Z","title":"NYU CTF Bench: A Scalable Open-Source Benchmark Dataset for Evaluating LLMs in Offensive Security","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05590","snapshot_observed_at":"2026-08-15T15:36:02.672780Z","title":"NYU CTF Bench: A scalable open-source benchmark dataset for evaluating LLMs in offensive security","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20911","last_updated":"2026-07-23T04:34:06Z","snapshot_observed_at":"2026-08-17T12:37:24.554486Z","submitted_at":"2026-07-23T04:34:06Z","title":"Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:02.672780Z"},"links":{"cited_paper":"/paper/2406.05590","citing_paper":"/paper/2607.20911"},"observation_digest":"sha256:229b4c8997712a6d2008962758bf6c07bf70eaa90db9cf182f09550985a28af3","observation_id":"89753231-60b7-4d4e-bbb6-a4eec87cab5c","resolution":{"observed_at":"2026-08-15T15:36:02.672780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14898","last_updated":"2023-10-30T17:52:18Z","snapshot_observed_at":"2026-08-16T15:20:59.876100Z","submitted_at":"2023-06-26T17:59:50Z","title":"InterCode: Standardizing and Benchmarking Interactive Coding with Execution Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14898","snapshot_observed_at":"2026-08-15T15:36:02.676898Z","title":"InterCode: Standard- izing and benchmarking interactive coding with execution feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20911","last_updated":"2026-07-23T04:34:06Z","snapshot_observed_at":"2026-08-17T12:37:24.554486Z","submitted_at":"2026-07-23T04:34:06Z","title":"Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:02.676898Z"},"links":{"cited_paper":"/paper/2306.14898","citing_paper":"/paper/2607.20911"},"observation_digest":"sha256:a52bd4d409c74e9d4f502f722326f920faa6674e1f944403f91fc340f4570a23","observation_id":"fd19d687-a554-4838-8eb8-40c39eb67ebb","resolution":{"observed_at":"2026-08-15T15:36:02.676898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17332","last_updated":"2025-06-24T04:10:59Z","snapshot_observed_at":"2026-08-16T12:47:52.443525Z","submitted_at":"2025-03-21T17:32:32Z","title":"CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17332","snapshot_observed_at":"2026-08-15T15:36:02.680411Z","title":"CVE-Bench: A benchmark for AI agents’ ability to exploit real-world web application vulnerabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20911","last_updated":"2026-07-23T04:34:06Z","snapshot_observed_at":"2026-08-17T12:37:24.554486Z","submitted_at":"2026-07-23T04:34:06Z","title":"Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:02.680411Z"},"links":{"cited_paper":"/paper/2503.17332","citing_paper":"/paper/2607.20911"},"observation_digest":"sha256:b0a1f26b7cd2c1af3b6ed1c6e5de19bae178d98cc919272bc86f92a18a34352f","observation_id":"27b9270f-cf53-42fd-96ab-6c1e058371f5","resolution":{"observed_at":"2026-08-15T15:36:02.680411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13161","last_updated":"2024-04-19T20:11:12Z","snapshot_observed_at":"2026-08-16T13:59:21.695627Z","submitted_at":"2024-04-19T20:11:12Z","title":"CyberSecEval 2: A Wide-Ranging Cybersecurity Evaluation Suite for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13161","snapshot_observed_at":"2026-08-15T15:36:02.684347Z","title":"CyberSecEval 2: A wide-ranging cybersecurity evaluation suite for large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20911","last_updated":"2026-07-23T04:34:06Z","snapshot_observed_at":"2026-08-17T12:37:24.554486Z","submitted_at":"2026-07-23T04:34:06Z","title":"Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:02.684347Z"},"links":{"cited_paper":"/paper/2404.13161","citing_paper":"/paper/2607.20911"},"observation_digest":"sha256:31e81ba0719b28a9ba65dd4a0100039cadea85fcd982098b7c4b713b9cda7e15","observation_id":"e7a8392e-6257-4529-abeb-a9af6c27a4a3","resolution":{"observed_at":"2026-08-15T15:36:02.684347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:36:03.078851Z","title":"CyberSecEval 3: Advancing the evaluation of cybersecurity risks and capabilities in large language models, 2024","venue":null,"work_id":"4941c6ab-d961-4b51-bdcd-7a1add0b9d89","year":2024},"citing_paper":{"arxiv_id":"2607.20911","last_updated":"2026-07-23T04:34:06Z","snapshot_observed_at":"2026-08-17T12:37:24.554486Z","submitted_at":"2026-07-23T04:34:06Z","title":"Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:02.687612Z"},"links":{"citing_paper":"/paper/2607.20911"},"observation_digest":"sha256:4ac33cd27a6ec005dc6086d7bd4637f1ea75823e9be0229a39e7ccbe9765fbc9","observation_id":"291bfb6a-69c1-4a23-a44c-26698bfae635","resolution":{"observed_at":"2026-08-15T15:36:03.084462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.20911","last_updated":"2026-07-23T04:34:06Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T12:37:24.554486Z","submitted_at":"2026-07-23T04:34:06Z","title":"Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2607.20911."}