{"as_of":"2026-08-04T09:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2a156598bb9d35226cf42b58f7563f64907937f11dfd857768a3e27a314ba9a9","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T13:28:05.021411Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T08:15:49.428124Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T10:59:46.438679Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.11042","last_updated":"2026-06-09T16:10:16Z","snapshot_observed_at":"2026-07-06T23:50:11.160843Z","submitted_at":"2026-06-09T16:10:16Z","title":"Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields","version":1},"cited_work":{"arxiv_id":"2606.11042","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.11042","snapshot_observed_at":"2026-07-04T10:59:46.438679Z","title":"Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields","venue":"cs.AI","work_id":"ad41fa7b-a77a-4c65-82a0-d8549e7ce6e5","year":2026},"citing_paper":{"arxiv_id":"2606.23049","last_updated":"2026-06-24T02:20:35Z","snapshot_observed_at":"2026-07-06T23:57:53.101659Z","submitted_at":"2026-06-22T08:57:54Z","title":"PhoneBuddy: Training Open Models for Agentic Phone Use","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-26T08:15:49.428124Z"},"links":{"cited_paper":"/paper/2606.11042","citing_paper":"/paper/2606.23049"},"observation_digest":"sha256:6064dfb618baaca33214dec0eb36989dcaedefeafafc85fa8802ce77905191d2","observation_id":"e706fb87-e870-4490-9019-da08b19cd982","resolution":{"observed_at":"2026-07-04T10:59:46.439972Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.11042/citation-record","integrity":"/paper/2606.11042/integrity","json":"/paper/2606.11042/citation-record.json","paper":"/paper/2606.11042"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.26506","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T05:07:38.676966Z","title":"Scuba: Salesforce computer use benchmark.arXiv preprint arXiv:2509.26506","venue":null,"work_id":"d2b6eaad-f645-47ea-aa64-548f741742b7","year":2025},"citing_paper":{"arxiv_id":"2606.11042","last_updated":"2026-06-09T16:10:16Z","snapshot_observed_at":"2026-07-06T23:50:11.160843Z","submitted_at":"2026-06-09T16:10:16Z","title":"Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T13:28:05.021411Z"},"links":{"citing_paper":"/paper/2606.11042"},"observation_digest":"sha256:9b276065760248ebb1d042c20cbd6c3f1963e950e64d3cf4dc2e1761e034cede","observation_id":"739c0fd9-0b1d-48c4-9a17-d6a92b49e40d","resolution":{"observed_at":"2026-07-03T05:07:38.678521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:28:05.021411Z","title":"Mobile-bench: An evaluation benchmark for llm-based mobile agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11042","last_updated":"2026-06-09T16:10:16Z","snapshot_observed_at":"2026-07-06T23:50:11.160843Z","submitted_at":"2026-06-09T16:10:16Z","title":"Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T13:28:05.021411Z"},"links":{"citing_paper":"/paper/2606.11042"},"observation_digest":"sha256:2b46166db57380a789382f60be394cf80fcd25ecc9ae13348e7231455e68c9a3","observation_id":"1dea3782-7b77-4dd0-b23f-f44813dccae6","resolution":{"observed_at":"2026-06-27T13:28:05.021411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.12730","doi":"10.48550/arxiv.2512.12730","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Nl2repo-bench: Towards long-horizon repository generation evaluation of coding agents.CoRR, abs/2512.12730","venue":null,"work_id":"0ea67a78-d9a4-4898-ab97-00d13ebca55f","year":2025},"citing_paper":{"arxiv_id":"2606.11042","last_updated":"2026-06-09T16:10:16Z","snapshot_observed_at":"2026-07-06T23:50:11.160843Z","submitted_at":"2026-06-09T16:10:16Z","title":"Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T13:28:05.021411Z"},"links":{"citing_paper":"/paper/2606.11042"},"observation_digest":"sha256:fa49d267ab0bc26443ba78681fb961b3733a105a98252a6e77dd6aff79625183","observation_id":"d584761e-f27d-4849-b843-09e1ad3769ea","resolution":{"observed_at":"2026-07-03T05:07:38.665109Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:28:05.021411Z","title":"Gemini 3.1 Pro Model Card, 4 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.11042","last_updated":"2026-06-09T16:10:16Z","snapshot_observed_at":"2026-07-06T23:50:11.160843Z","submitted_at":"2026-06-09T16:10:16Z","title":"Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T13:28:05.021411Z"},"links":{"citing_paper":"/paper/2606.11042"},"observation_digest":"sha256:c87e061f53b95531ee8b6a960e2f9628ad24c8eaf796da63557ddaadda3e3c3d","observation_id":"0a99caf9-2e69-451f-a7fd-a6cbb348ad72","resolution":{"observed_at":"2026-06-27T13:28:05.021411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:28:05.021411Z","title":"Gemini 3 Flash Model Card, 4 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.11042","last_updated":"2026-06-09T16:10:16Z","snapshot_observed_at":"2026-07-06T23:50:11.160843Z","submitted_at":"2026-06-09T16:10:16Z","title":"Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T13:28:05.021411Z"},"links":{"citing_paper":"/paper/2606.11042"},"observation_digest":"sha256:aba112fd9793c5fd8ccd077cd606c59bcc096fa6310fd84f1fc52395d434f0dd","observation_id":"5d21d009-ed9c-48a7-a507-f62fada26e51","resolution":{"observed_at":"2026-06-27T13:28:05.021411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14282","last_updated":"2025-02-21T02:54:09Z","snapshot_observed_at":"2026-07-06T20:39:33.620222Z","submitted_at":"2025-02-20T05:41:55Z","title":"PC-Agent: A Hierarchical Multi-Agent Collaboration Framework for Complex Task Automation on PC","version":2},"cited_work":{"arxiv_id":"2502.14282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.14282","snapshot_observed_at":"2026-07-03T05:07:38.657472Z","title":"Pc-agent: A hierarchical multi-agent collaboration framework for complex task automation on pc","venue":null,"work_id":"bf33d8e4-a2f0-45d4-a970-1fdd6689bd96","year":2025},"citing_paper":{"arxiv_id":"2606.11042","last_updated":"2026-06-09T16:10:16Z","snapshot_observed_at":"2026-07-06T23:50:11.160843Z","submitted_at":"2026-06-09T16:10:16Z","title":"Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T13:28:05.021411Z"},"links":{"cited_paper":"/paper/2502.14282","citing_paper":"/paper/2606.11042"},"observation_digest":"sha256:f6ea2ffa8ea32df26b8d496e5c6e6b7ad153199c9befd8243f573e8ad9048f8f","observation_id":"d241ce8f-b2d6-4327-a520-42ac33d38aee","resolution":{"observed_at":"2026-07-03T05:07:38.659003Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11868","last_updated":"2026-01-17T01:29:30Z","snapshot_observed_at":"2026-07-06T22:41:58.373427Z","submitted_at":"2026-01-17T01:29:30Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","version":1},"cited_work":{"arxiv_id":"2601.11868","doi":"10.48550/arxiv.2302.01973","metadata_source":"pith","pith_arxiv_id":"2601.11868","snapshot_observed_at":"2026-07-10T19:57:33.802494Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","venue":"cs.SE","work_id":"0624be05-1d97-4fd6-8300-b04b8a3ab04b","year":2026},"citing_paper":{"arxiv_id":"2606.11042","last_updated":"2026-06-09T16:10:16Z","snapshot_observed_at":"2026-07-06T23:50:11.160843Z","submitted_at":"2026-06-09T16:10:16Z","title":"Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T13:28:05.021411Z"},"links":{"cited_paper":"/paper/2601.11868","citing_paper":"/paper/2606.11042"},"observation_digest":"sha256:6e2e22e0ac90cb6193269236406ead0f69882dcdacaa92bb6b5ddf15a7d55cad","observation_id":"b667ee27-817f-4460-9754-f6cdcc575b4e","resolution":{"observed_at":"2026-07-03T05:07:38.670710Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:28:05.021411Z","title":"Kimi k2.6: Advancing open-source coding.https://www.kimi.com/blog/kimi-k2-6, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.11042","last_updated":"2026-06-09T16:10:16Z","snapshot_observed_at":"2026-07-06T23:50:11.160843Z","submitted_at":"2026-06-09T16:10:16Z","title":"Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T13:28:05.021411Z"},"links":{"citing_paper":"/paper/2606.11042"},"observation_digest":"sha256:98dde1b9ae8a74210b8fb2dc402f5bc115c79d06549d6bb590eaceaa6b3c23a7","observation_id":"8875a492-36e8-47e7-8540-6f62fa8b3cbe","resolution":{"observed_at":"2026-06-27T13:28:05.021411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:28:05.021411Z","title":"Gui-360: A comprehensive dataset and benchmark for computer-using agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11042","last_updated":"2026-06-09T16:10:16Z","snapshot_observed_at":"2026-07-06T23:50:11.160843Z","submitted_at":"2026-06-09T16:10:16Z","title":"Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T13:28:05.021411Z"},"links":{"citing_paper":"/paper/2606.11042"},"observation_digest":"sha256:d431cb04c7d89551eac5d686ab62675984f4f01d543895bef565b3d48d13acea","observation_id":"bcc1f9c1-1d84-4617-a312-be721c649a08","resolution":{"observed_at":"2026-06-27T13:28:05.021411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:28:05.021411Z","title":"Gpt-5.4 thinking system card","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.11042","last_updated":"2026-06-09T16:10:16Z","snapshot_observed_at":"2026-07-06T23:50:11.160843Z","submitted_at":"2026-06-09T16:10:16Z","title":"Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T13:28:05.021411Z"},"links":{"citing_paper":"/paper/2606.11042"},"observation_digest":"sha256:d35a28c2a983300e38a6a78f9c7005a6c736535af718982b908d4b6017b1df4b","observation_id":"75598cf3-99c0-46cb-adfd-fea6bd5dea9a","resolution":{"observed_at":"2026-06-27T13:28:05.021411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04374","last_updated":"2025-10-05T21:36:43Z","snapshot_observed_at":"2026-07-06T22:31:44.964774Z","submitted_at":"2025-10-05T21:36:43Z","title":"GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks","version":1},"cited_work":{"arxiv_id":"2510.04374","doi":"10.3102/0013189x023002005","metadata_source":"pith","pith_arxiv_id":"2510.04374","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks","venue":"cs.LG","work_id":"6eca346e-0e48-4240-961c-1ecee1e71aab","year":2025},"citing_paper":{"arxiv_id":"2606.11042","last_updated":"2026-06-09T16:10:16Z","snapshot_observed_at":"2026-07-06T23:50:11.160843Z","submitted_at":"2026-06-09T16:10:16Z","title":"Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T13:28:05.021411Z"},"links":{"cited_paper":"/paper/2510.04374","citing_paper":"/paper/2606.11042"},"observation_digest":"sha256:bbcf4df2d62eb8b8a6197412779b67e42191cb5b49351e66ca3a79537541433d","observation_id":"6e9fa475-88ba-4233-8b68-c303dd04aadc","resolution":{"observed_at":"2026-07-03T05:07:38.674949Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14573","last_updated":"2025-04-06T20:37:50Z","snapshot_observed_at":"2026-07-06T18:18:39.093732Z","submitted_at":"2024-05-23T13:48:54Z","title":"AndroidWorld: A Dynamic Benchmarking Environment for Autonomous Agents","version":5},"cited_work":{"arxiv_id":"2405.14573","doi":"10.48550/arxiv.2405.14573","metadata_source":"pith","pith_arxiv_id":"2405.14573","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AndroidWorld: A Dynamic Benchmarking Environment for Autonomous Agents","venue":"cs.AI","work_id":"c5116d19-d3d3-40fd-9620-f7489812a9ba","year":2024},"citing_paper":{"arxiv_id":"2606.11042","last_updated":"2026-06-09T16:10:16Z","snapshot_observed_at":"2026-07-06T23:50:11.160843Z","submitted_at":"2026-06-09T16:10:16Z","title":"Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T13:28:05.021411Z"},"links":{"cited_paper":"/paper/2405.14573","citing_paper":"/paper/2606.11042"},"observation_digest":"sha256:bd24b163d888fa9e3e73a19ebb95e5c1484fc6b2d99c4e37911b314e6febf183","observation_id":"17706fb0-47d6-490a-b0fd-599b1311df14","resolution":{"observed_at":"2026-07-03T05:07:38.667134Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.20633","last_updated":"2026-04-17T08:57:17Z","snapshot_observed_at":"2026-07-06T22:49:57.103822Z","submitted_at":"2026-03-21T04:03:45Z","title":"Seed1.8 Model Card: Towards Generalized Real-World Agency","version":3},"cited_work":{"arxiv_id":"2603.20633","doi":"10.48550/arxiv.2603.20633","metadata_source":"pith","pith_arxiv_id":"2603.20633","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Seed1.8 Model Card: Towards Generalized Real-World Agency","venue":"cs.AI","work_id":"f4c6b2eb-a6df-456a-8043-500d8b250763","year":2026},"citing_paper":{"arxiv_id":"2606.11042","last_updated":"2026-06-09T16:10:16Z","snapshot_observed_at":"2026-07-06T23:50:11.160843Z","submitted_at":"2026-06-09T16:10:16Z","title":"Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T13:28:05.021411Z"},"links":{"cited_paper":"/paper/2603.20633","citing_paper":"/paper/2606.11042"},"observation_digest":"sha256:0bfa316a7a0ac74b4b1588f24a92e9b83997b8af0821b5dccf09eca28c6f52e0","observation_id":"6c1ddbea-2477-4852-9c3b-567f4b9b491c","resolution":{"observed_at":"2026-07-03T05:07:38.675829Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:28:05.021411Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.11042","last_updated":"2026-06-09T16:10:16Z","snapshot_observed_at":"2026-07-06T23:50:11.160843Z","submitted_at":"2026-06-09T16:10:16Z","title":"Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T13:28:05.021411Z"},"links":{"citing_paper":"/paper/2606.11042"},"observation_digest":"sha256:4b09e401fc54368bcf9cc26f7086e874318d6fd376e04fb3b5ec497945c44871","observation_id":"3f38fb24-7d95-40ea-ab79-7ef0765cada2","resolution":{"observed_at":"2026-06-27T13:28:05.021411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.26098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T05:07:38.666234Z","title":"Gui knowledge bench: Revealing the knowledge gap behind vlm failures in gui tasks","venue":null,"work_id":"f7787876-9837-499d-a464-26956057e78f","year":2025},"citing_paper":{"arxiv_id":"2606.11042","last_updated":"2026-06-09T16:10:16Z","snapshot_observed_at":"2026-07-06T23:50:11.160843Z","submitted_at":"2026-06-09T16:10:16Z","title":"Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T13:28:05.021411Z"},"links":{"citing_paper":"/paper/2606.11042"},"observation_digest":"sha256:8f3601901267c1a57ee48086e4cd9464ef5f37c83dc6454e39148396675732c5","observation_id":"a6c52a60-b540-43ea-9d65-26348d409fb4","resolution":{"observed_at":"2026-07-03T05:07:38.667708Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.11750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T05:07:38.638548Z","title":"Ambibench: Benchmarking mobile gui agents beyond one-shot instructions in the wild","venue":null,"work_id":"7419d9c8-674f-4b6c-968b-0351c4aa4b3c","year":2026},"citing_paper":{"arxiv_id":"2606.11042","last_updated":"2026-06-09T16:10:16Z","snapshot_observed_at":"2026-07-06T23:50:11.160843Z","submitted_at":"2026-06-09T16:10:16Z","title":"Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T13:28:05.021411Z"},"links":{"citing_paper":"/paper/2606.11042"},"observation_digest":"sha256:9faa7f8956f097522466ee62430ff29ea9b3871ed918ad112a9a43e4d5321e0e","observation_id":"e83153bb-2699-4bd1-93d9-dde3ae3fa131","resolution":{"observed_at":"2026-07-03T05:07:38.640426Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19897","last_updated":"2026-04-20T16:29:04Z","snapshot_observed_at":"2026-07-06T21:30:37.657153Z","submitted_at":"2025-05-26T12:27:27Z","title":"ScienceBoard: Evaluating Multimodal Autonomous Agents in Realistic Scientific Workflows","version":3},"cited_work":{"arxiv_id":"2505.19897","doi":"10.48550/arxiv.2505.19897","metadata_source":"pith","pith_arxiv_id":"2505.19897","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"ScienceBoard: Evaluating Multimodal Autonomous Agents in Realistic Scientific Workflows","venue":"cs.AI","work_id":"5ee5b393-bfc6-4413-b046-8c3968b2dab1","year":2025},"citing_paper":{"arxiv_id":"2606.11042","last_updated":"2026-06-09T16:10:16Z","snapshot_observed_at":"2026-07-06T23:50:11.160843Z","submitted_at":"2026-06-09T16:10:16Z","title":"Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T13:28:05.021411Z"},"links":{"cited_paper":"/paper/2505.19897","citing_paper":"/paper/2606.11042"},"observation_digest":"sha256:24dba371bc1802eff3d1d069ef6e3c42d4e7073a069fcb9e25a41d03a96fce48","observation_id":"cd5a18d6-3e34-4632-9bdc-dca0ecd1c6e2","resolution":{"observed_at":"2026-07-03T05:07:38.650508Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02544","last_updated":"2025-09-05T14:59:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-02T17:44:45Z","title":"UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2509.02544","doi":"10.1037/xlm0000535","metadata_source":"pith","pith_arxiv_id":"2509.02544","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning","venue":"cs.AI","work_id":"422846c6-e6e2-47c9-9065-85cc09c07cd6","year":2025},"citing_paper":{"arxiv_id":"2606.11042","last_updated":"2026-06-09T16:10:16Z","snapshot_observed_at":"2026-07-06T23:50:11.160843Z","submitted_at":"2026-06-09T16:10:16Z","title":"Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T13:28:05.021411Z"},"links":{"cited_paper":"/paper/2509.02544","citing_paper":"/paper/2606.11042"},"observation_digest":"sha256:5a90dd68ca9aabc7746e5adce0b89c08442b43ad4d1f6143c7efa00975fd03a1","observation_id":"4b4a3584-ce2e-4e57-af1c-679cc85e6fd8","resolution":{"observed_at":"2026-07-03T05:07:38.654126Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16741","last_updated":"2025-04-18T18:14:31Z","snapshot_observed_at":"2026-08-02T14:58:44.167588Z","submitted_at":"2024-07-23T17:50:43Z","title":"OpenHands: An Open Platform for AI Software Developers as Generalist Agents","version":3},"cited_work":{"arxiv_id":"2407.16741","doi":"10.1145/3718958.3750537","metadata_source":"pith","pith_arxiv_id":"2407.16741","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"OpenHands: An Open Platform for AI Software Developers as Generalist Agents","venue":"cs.SE","work_id":"f1762ea0-e382-4f38-a28c-adc643789859","year":2024},"citing_paper":{"arxiv_id":"2606.11042","last_updated":"2026-06-09T16:10:16Z","snapshot_observed_at":"2026-07-06T23:50:11.160843Z","submitted_at":"2026-06-09T16:10:16Z","title":"Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T13:28:05.021411Z"},"links":{"cited_paper":"/paper/2407.16741","citing_paper":"/paper/2606.11042"},"observation_digest":"sha256:af518aeca7bebab06ddd0a7180a62ad8eee5eb05d9f52ff03cbc98670b51b6d0","observation_id":"1a31f9f4-15b1-4723-88a6-67440f298c3f","resolution":{"observed_at":"2026-07-03T05:07:38.673400Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:28:05.021411Z","title":"Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments.Advancesin Neural Information Processing Systems, 37:52040–52094, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11042","last_updated":"2026-06-09T16:10:16Z","snapshot_observed_at":"2026-07-06T23:50:11.160843Z","submitted_at":"2026-06-09T16:10:16Z","title":"Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T13:28:05.021411Z"},"links":{"citing_paper":"/paper/2606.11042"},"observation_digest":"sha256:35fd9dec5fef7b7c90e83b9c739d09346d767bfd09f3e7c52354e8032ea85829","observation_id":"526cc51e-cb90-40dd-bb92-f1c803c8ec40","resolution":{"observed_at":"2026-06-27T13:28:05.021411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.15431","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:59:46.386048Z","title":"Step-gui technical report","venue":null,"work_id":"f35707d8-9d5b-4699-b69e-76e248bb53ca","year":2025},"citing_paper":{"arxiv_id":"2606.11042","last_updated":"2026-06-09T16:10:16Z","snapshot_observed_at":"2026-07-06T23:50:11.160843Z","submitted_at":"2026-06-09T16:10:16Z","title":"Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T13:28:05.021411Z"},"links":{"citing_paper":"/paper/2606.11042"},"observation_digest":"sha256:3e198ef0675d120df3f9d828ceb083d6fadbf71fe9c724249bd1d36ec6e54635","observation_id":"517d22f5-d31f-4a81-a0ab-5a6bcad9c604","resolution":{"observed_at":"2026-07-03T05:07:38.661888Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.07980","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:00:08.402369Z","title":"$OneMillion-Bench: How far are language agents from human experts?arXiv preprint arXiv:2603.07980","venue":null,"work_id":"8519ff23-797d-41f2-834f-3bd0f249949d","year":2026},"citing_paper":{"arxiv_id":"2606.11042","last_updated":"2026-06-09T16:10:16Z","snapshot_observed_at":"2026-07-06T23:50:11.160843Z","submitted_at":"2026-06-09T16:10:16Z","title":"Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T13:28:05.021411Z"},"links":{"citing_paper":"/paper/2606.11042"},"observation_digest":"sha256:e52b077d2bf3b1efd7b4cb3e698aa8d3a5ca7f8026a74a78fda89b01f37a8b62","observation_id":"d49dfc8a-2439-4240-93be-1f2fca21552c","resolution":{"observed_at":"2026-07-03T05:07:38.656946Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:28:05.021411Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.11042","last_updated":"2026-06-09T16:10:16Z","snapshot_observed_at":"2026-07-06T23:50:11.160843Z","submitted_at":"2026-06-09T16:10:16Z","title":"Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T13:28:05.021411Z"},"links":{"citing_paper":"/paper/2606.11042"},"observation_digest":"sha256:0632c84d94661015b0ffc86e178c6ddb0c117b2814a65133ad0493328bb1e8e8","observation_id":"97b7b588-17be-4d09-a2d8-1e819bc140a1","resolution":{"observed_at":"2026-06-27T13:28:05.021411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.11042","last_updated":"2026-06-09T16:10:16Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T23:50:11.160843Z","submitted_at":"2026-06-09T16:10:16Z","title":"Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":14,"verified_fuzzy":0},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 1 inbound Pith citation observation for arXiv:2606.11042."}