{"as_of":"2026-08-18T03:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5a9b4d80d3c152038b6cd2b7dc70795007c587d4cea87b04892c60db03fe3cf9","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:33:58.386115Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:46:01.921739Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T16:58:43.632383Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07672","snapshot_observed_at":"2026-08-06T16:46:01.921739Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12806","last_updated":"2025-08-01T22:37:16Z","snapshot_observed_at":"2026-08-09T01:25:07.357969Z","submitted_at":"2025-07-17T05:46:27Z","title":"MCPEval: Automatic MCP-based Deep Evaluation for AI Agent Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T16:46:01.921739Z"},"links":{"cited_paper":"/paper/2506.07672","citing_paper":"/paper/2507.12806"},"observation_digest":"sha256:f90c84aec0059c3fa9be5cefa706de5205db49be380a448b72f1be8a8bf21aa7","observation_id":"1eb775e8-6a66-43bf-8819-92406bbd28fe","resolution":{"observed_at":"2026-08-06T16:46:01.921739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07672","snapshot_observed_at":"2026-08-05T18:22:38.827026Z","title":"Mcpworld: A unified benchmarking testbed for api, gui, and hybrid computer use agents,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.14703","last_updated":"2025-08-20T13:28:39Z","snapshot_observed_at":"2026-08-16T08:54:25.172709Z","submitted_at":"2025-08-20T13:28:39Z","title":"A Lightweight Incentive-Based Privacy-Preserving Smart Metering Protocol for Value-Added Services","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T18:22:38.827026Z"},"links":{"cited_paper":"/paper/2506.07672","citing_paper":"/paper/2508.14703"},"observation_digest":"sha256:b642bb2128af7c21c597bbdcd0ca2dbb52a9d81280afda16c57fe2de5c9f9503","observation_id":"f7a0d013-03b6-4926-ba85-d75d3e15b9c3","resolution":{"observed_at":"2026-08-05T18:22:38.827026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07672","snapshot_observed_at":"2026-08-03T17:30:53.019433Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.09706","last_updated":"2026-06-04T08:39:05Z","snapshot_observed_at":"2026-08-14T03:01:03.770741Z","submitted_at":"2025-12-10T14:52:29Z","title":"Training One Model to Master Cross-Level Agentic Actions via Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T17:30:53.019433Z"},"links":{"cited_paper":"/paper/2506.07672","citing_paper":"/paper/2512.09706"},"observation_digest":"sha256:6dd9cffba8d49937daa024e42df092ead746773fb000535b0eaf4d951a863284","observation_id":"a376052b-e262-43f6-a908-9614e1ff5ffc","resolution":{"observed_at":"2026-08-03T17:30:53.019433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"cited_work":{"arxiv_id":"2506.07672","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07672","snapshot_observed_at":"2026-07-03T16:58:43.632383Z","title":"arXiv preprint arXiv:2506.07672 , year=","venue":null,"work_id":"2b448a38-d99a-47ec-ad81-c94e78b0031c","year":2025},"citing_paper":{"arxiv_id":"2602.10139","last_updated":"2026-04-26T01:34:23Z","snapshot_observed_at":"2026-08-14T10:04:04.434798Z","submitted_at":"2026-02-08T15:50:04Z","title":"Anonymization-Enhanced Privacy Protection for Mobile GUI Agents: Available but Invisible","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T05:59:32.583411Z"},"links":{"cited_paper":"/paper/2506.07672","citing_paper":"/paper/2602.10139"},"observation_digest":"sha256:0ac6566949be3d0ce5065ba51feeaf004f691b2623968fde5ce2f4a1397cd56c","observation_id":"243bc8a0-b7dc-4bf8-b652-ccd629528d4a","resolution":{"observed_at":"2026-05-16T06:00:40.675891Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07672","snapshot_observed_at":"2026-08-02T23:04:39.079613Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.14878","last_updated":"2026-05-31T05:10:10Z","snapshot_observed_at":"2026-08-15T03:13:00.015257Z","submitted_at":"2026-02-16T16:10:11Z","title":"Model Context Protocol (MCP) Tool Descriptions Are Smelly! Towards Improving AI Agent Efficiency with Augmented MCP Tool Descriptions","version":3},"reference_index":111,"source":"pdf_text","source_observed_at":"2026-08-02T23:04:39.079613Z"},"links":{"cited_paper":"/paper/2506.07672","citing_paper":"/paper/2602.14878"},"observation_digest":"sha256:5e69a987eb953dd96965d312b94bd491ef00aa185a559b0aeb8b49d6e8c7168c","observation_id":"8452a3a0-eee1-4771-b103-ebfb2b7bf7b6","resolution":{"observed_at":"2026-08-02T23:04:39.079613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"cited_work":{"arxiv_id":"2506.07672","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07672","snapshot_observed_at":"2026-07-03T16:58:43.632383Z","title":"arXiv preprint arXiv:2506.07672 , year=","venue":null,"work_id":"2b448a38-d99a-47ec-ad81-c94e78b0031c","year":2025},"citing_paper":{"arxiv_id":"2604.09815","last_updated":"2026-04-10T18:46:05Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:46:05Z","title":"EE-MCP: Self-Evolving MCP-GUI Agents via Automated Environment Generation and Experience Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T17:36:20.156978Z"},"links":{"cited_paper":"/paper/2506.07672","citing_paper":"/paper/2604.09815"},"observation_digest":"sha256:e36131bbebbec847e836810c907cd4500525d12902e09149bf044db1c38755c8","observation_id":"4f449e7c-a18d-4988-bc25-02914ce5608a","resolution":{"observed_at":"2026-05-11T06:31:01.900336Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"cited_work":{"arxiv_id":"2506.07672","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07672","snapshot_observed_at":"2026-07-03T16:58:43.632383Z","title":"arXiv preprint arXiv:2506.07672 , year=","venue":null,"work_id":"2b448a38-d99a-47ec-ad81-c94e78b0031c","year":2025},"citing_paper":{"arxiv_id":"2605.10787","last_updated":"2026-05-20T01:39:17Z","snapshot_observed_at":"2026-08-12T22:55:54.365434Z","submitted_at":"2026-05-11T16:20:51Z","title":"ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-12T04:42:47.496496Z"},"links":{"cited_paper":"/paper/2506.07672","citing_paper":"/paper/2605.10787"},"observation_digest":"sha256:9bf28b53955a08dbe55359843689ad4dd3dd9bd29169a0d5db2e9f2fc4a1611f","observation_id":"8bfd9166-add6-4c7a-82d4-3864fde10f51","resolution":{"observed_at":"2026-05-12T06:01:23.427442Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"cited_work":{"arxiv_id":"2506.07672","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07672","snapshot_observed_at":"2026-07-03T16:58:43.632383Z","title":"arXiv preprint arXiv:2506.07672 , year=","venue":null,"work_id":"2b448a38-d99a-47ec-ad81-c94e78b0031c","year":2025},"citing_paper":{"arxiv_id":"2605.10787","last_updated":"2026-05-20T01:39:17Z","snapshot_observed_at":"2026-08-12T22:55:54.365434Z","submitted_at":"2026-05-11T16:20:51Z","title":"ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-21T08:08:04.544564Z"},"links":{"cited_paper":"/paper/2506.07672","citing_paper":"/paper/2605.10787"},"observation_digest":"sha256:a74f92244e4bc6081d67a19bbb9cfe71ffade689e2d9d7e439338d0daeaf5332","observation_id":"f49e1e44-bb4c-4f36-a2b7-306019a8585a","resolution":{"observed_at":"2026-05-21T08:09:51.280527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"cited_work":{"arxiv_id":"2506.07672","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07672","snapshot_observed_at":"2026-07-03T16:58:43.632383Z","title":"arXiv preprint arXiv:2506.07672 , year=","venue":null,"work_id":"2b448a38-d99a-47ec-ad81-c94e78b0031c","year":2025},"citing_paper":{"arxiv_id":"2605.12481","last_updated":"2026-05-12T17:57:04Z","snapshot_observed_at":"2026-08-09T08:12:42.231591Z","submitted_at":"2026-05-12T17:57:04Z","title":"ToolCUA: Towards Optimal GUI-Tool Path Orchestration for Computer Use Agents","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-13T03:51:54.401200Z"},"links":{"cited_paper":"/paper/2506.07672","citing_paper":"/paper/2605.12481"},"observation_digest":"sha256:4af61a005b10da333e1505a3f15786decae84b8cbfefb705dc00b47e24cb1be6","observation_id":"261775e9-2254-43bf-88f9-877dfd391f50","resolution":{"observed_at":"2026-05-13T03:52:12.452282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"cited_work":{"arxiv_id":"2506.07672","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07672","snapshot_observed_at":"2026-07-03T16:58:43.632383Z","title":"arXiv preprint arXiv:2506.07672 , year=","venue":null,"work_id":"2b448a38-d99a-47ec-ad81-c94e78b0031c","year":2025},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-08-17T01:43:03.923615Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":147,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2506.07672","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:fbfde29f6546c6d4ca5b3712ba76d9994674a88b605f6fada81608a6adc84854","observation_id":"fb7162ca-d5fd-4e02-b581-07cc2e7b2a23","resolution":{"observed_at":"2026-07-03T16:58:43.634306Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07672","snapshot_observed_at":"2026-08-01T05:06:47.508954Z","title":"MCPWorld: A unified benchmarking testbed for API, GUI, and hybrid computer use agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22798","last_updated":"2026-07-24T14:17:03Z","snapshot_observed_at":"2026-08-16T00:12:03.277856Z","submitted_at":"2026-07-24T14:17:03Z","title":"StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T05:06:47.508954Z"},"links":{"cited_paper":"/paper/2506.07672","citing_paper":"/paper/2607.22798"},"observation_digest":"sha256:1b590a904b1f272ebb0deac82f295f3d93650a74059d32256e9762cc99fc605c","observation_id":"54bcb467-5f8b-4bee-8936-51e2332a4f7a","resolution":{"observed_at":"2026-08-01T05:06:47.508954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07672","snapshot_observed_at":"2026-08-04T22:55:34.013951Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01684","last_updated":"2026-08-03T04:18:31Z","snapshot_observed_at":"2026-08-17T14:05:08.138252Z","submitted_at":"2026-08-03T04:18:31Z","title":"GABench: A Comprehensive Benchmark for Evaluating LLM Agents on Graph Analysis Tasks","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:34.013951Z"},"links":{"cited_paper":"/paper/2506.07672","citing_paper":"/paper/2608.01684"},"observation_digest":"sha256:ed9653046aedad9b3e405e6282bf99326942b3cfb14227cf9ecfb684441968f4","observation_id":"38416ba2-78e4-47d3-80f4-95207af0287a","resolution":{"observed_at":"2026-08-04T22:55:34.013951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07672/citation-record","integrity":"/paper/2506.07672/integrity","json":"/paper/2506.07672/citation-record.json","paper":"/paper/2506.07672"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:58.929877Z","title":"Introducing computer use, a new claude 3.5 sonnet, and claude 3.5 haiku","venue":null,"work_id":"0abfd8e7-6018-4006-ab85-1068c8750e9b","year":null},"citing_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:58.246595Z"},"links":{"citing_paper":"/paper/2506.07672"},"observation_digest":"sha256:ed05405b1555f5b809403f5d71830aac71f201e5fbe0a3ee700fd4cc64445bce","observation_id":"eaee963a-aa0b-4b5f-8cd0-b53c12bf713c","resolution":{"observed_at":"2026-08-07T05:33:58.934356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:58.915427Z","title":"Introduction: Get started with the model context protocol (mcp)","venue":null,"work_id":"865fe093-172f-4089-8bcc-be1f91aa0a20","year":null},"citing_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:58.251610Z"},"links":{"citing_paper":"/paper/2506.07672"},"observation_digest":"sha256:8846a4783f2c8ba1d7c3f93f6b9e71a56b771d102baad4a5e44ab3b9184b017b","observation_id":"e058cd25-d30f-4b56-8da8-6701a7555d12","resolution":{"observed_at":"2026-08-07T05:33:58.919779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:58.900707Z","title":"Meet claude on your desktop.https://claude.ai/download","venue":null,"work_id":"a9fccc22-aa9c-486c-a76f-43313d5bcd1a","year":null},"citing_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:58.256128Z"},"links":{"citing_paper":"/paper/2506.07672"},"observation_digest":"sha256:15cb53e565fdb193b916bdd9c4dbbc2ea401f0a7345f9fcb9beaebb7f34e9d22","observation_id":"dceaab9d-650c-4a70-a07b-a634e8efa602","resolution":{"observed_at":"2026-08-07T05:33:58.905409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:58.260760Z","title":"Windows agent arena: Evaluating multi-modal os agents at scale, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:58.260760Z"},"links":{"citing_paper":"/paper/2506.07672"},"observation_digest":"sha256:ff15c2a62b57c7eadd7c57571d35ab5ce6c06a81d1006a66caf22811082487e6","observation_id":"d2b76e7c-03bf-4da4-a1ba-01548684e441","resolution":{"observed_at":"2026-08-07T05:33:58.260760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:58.876038Z","title":"A3: Android agent arena for mobile gui agents, 2025","venue":null,"work_id":"9a9ad021-f034-4394-8138-9818ebbf6a3d","year":2025},"citing_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:58.265043Z"},"links":{"citing_paper":"/paper/2506.07672"},"observation_digest":"sha256:ed152ed6c80b78ef68ae9da0e672dc0d30773e9e10d3eb5ae57b6477240c5bdb","observation_id":"6f764a53-b59f-44af-85a9-4ada300ed073","resolution":{"observed_at":"2026-08-07T05:33:58.880983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:58.269202Z","title":"Laradji, Manuel Del Verme, Tom Marty, Léo Boisvert, Megh Thakkar, Quentin Cappart, David Vazquez, Nicolas Chapados, and Alexandre Lacoste","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:58.269202Z"},"links":{"citing_paper":"/paper/2506.07672"},"observation_digest":"sha256:a57d485c0a17250891267bc2bc4402e4137c7bce9d2a2e446bf46753204bd515","observation_id":"e807f8f9-4233-487c-bcf9-4ac7ee8d0a0e","resolution":{"observed_at":"2026-08-07T05:33:58.269202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:58.851867Z","title":"Assistgui: Task-oriented desktop graphical user interface automation, 2024","venue":null,"work_id":"44506704-4343-428d-8618-8993f523dcd7","year":2024},"citing_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:58.273527Z"},"links":{"citing_paper":"/paper/2506.07672"},"observation_digest":"sha256:1bf09aae52b85c744bf700c995c664b368d12a33e828679481084aa0d5d4d90a","observation_id":"72881521-7e87-4faf-98c0-e8dc51a3ad41","resolution":{"observed_at":"2026-08-07T05:33:58.856300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:58.277591Z","title":"Visualwebarena: Evaluating multimodal agents on realistic visual web tasks, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:58.277591Z"},"links":{"citing_paper":"/paper/2506.07672"},"observation_digest":"sha256:249c9475d1db28d6862b54ac30dd2e39c6cbdfc0bf17e4d7e40bddb3d72529aa","observation_id":"eda22142-cf68-44bf-809b-b147cab8e364","resolution":{"observed_at":"2026-08-07T05:33:58.277591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:58.827078Z","title":"Benchmarking mobile device control agents across diverse configurations, 2024","venue":null,"work_id":"69e8d102-0705-4b1f-b663-183c7df03e58","year":2024},"citing_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:58.281684Z"},"links":{"citing_paper":"/paper/2506.07672"},"observation_digest":"sha256:f9081b305d71997903ccb71414582c3df078a4d7cbc74ce80d0ff574171e5323","observation_id":"e366c75e-1aa1-42a2-a0ec-6a21b2af849b","resolution":{"observed_at":"2026-08-07T05:33:58.831507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:58.286383Z","title":"Api-bank: A comprehensive benchmark for tool-augmented llms, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:58.286383Z"},"links":{"citing_paper":"/paper/2506.07672"},"observation_digest":"sha256:0dc57e13dbdb878cac383f4ed14ee86e0d4efb2110c0e8f8adcaa99c5f5f2ebe","observation_id":"19b9a591-088b-4388-a78d-0b489a24bd90","resolution":{"observed_at":"2026-08-07T05:33:58.286383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:58.290338Z","title":"Taskmatrix.ai: Completing tasks by connecting foundation models with millions of apis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:58.290338Z"},"links":{"citing_paper":"/paper/2506.07672"},"observation_digest":"sha256:1c3725ee5636b5189c350f23094bbc25d265e54d97ba6ae2de63f426be3ad59e","observation_id":"85903456-8f0e-43f0-a946-3525259a066e","resolution":{"observed_at":"2026-08-07T05:33:58.290338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:58.294843Z","title":"Agentbench: Evaluating llms as agents, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:58.294843Z"},"links":{"citing_paper":"/paper/2506.07672"},"observation_digest":"sha256:b6c81bd56b7329ea9dae3bf8eb8ba04c22d643dafdccb3e9177d62d448b05c1b","observation_id":"0aa625ee-5d04-429c-b941-8ec062da36c4","resolution":{"observed_at":"2026-08-07T05:33:58.294843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:58.299023Z","title":"Visualagentbench: Towards large multimodal models as visual foundation agents, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:58.299023Z"},"links":{"citing_paper":"/paper/2506.07672"},"observation_digest":"sha256:31e9a7388370f06b4ab276fca43d63317975ad619578434b06c1efee6845382e","observation_id":"d555a05a-f408-42ab-978b-1da359530623","resolution":{"observed_at":"2026-08-07T05:33:58.299023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:58.303282Z","title":"Gaia: a benchmark for general ai assistants, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:58.303282Z"},"links":{"citing_paper":"/paper/2506.07672"},"observation_digest":"sha256:21ffd06ab79b54994a2b7c6ab50eebc0df0d7e2954674fe34f96961dfa09644f","observation_id":"a8d0c7ad-1906-4a8c-a58a-513240d4ae18","resolution":{"observed_at":"2026-08-07T05:33:58.303282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:58.760213Z","title":"frida: Dynamic instrumentation toolkit for developers, reverse-engineers, and security researchers.https://frida.re/","venue":null,"work_id":"f46efcde-b75b-4795-845c-efdc9761987e","year":null},"citing_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:58.307530Z"},"links":{"citing_paper":"/paper/2506.07672"},"observation_digest":"sha256:d6a395e89b2be91e7166bb9e7d2e5ce7e7713a5a9d542da8d6f952ddc62573b2","observation_id":"f7e54e52-42bf-4589-98e1-0621f48726a5","resolution":{"observed_at":"2026-08-07T05:33:58.765095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:58.311650Z","title":"Toolllm: Facilitating large language models to master 16000+ real-world apis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:58.311650Z"},"links":{"citing_paper":"/paper/2506.07672"},"observation_digest":"sha256:7996ecc0c08cf63e30dacd0e419358588226e7b491cd105273628432db7afa8a","observation_id":"336c54e4-858c-4979-b564-d623d567a642","resolution":{"observed_at":"2026-08-07T05:33:58.311650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:58.315923Z","title":"Androidworld: A dynamic benchmarking environment for autonomous agents, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:58.315923Z"},"links":{"citing_paper":"/paper/2506.07672"},"observation_digest":"sha256:ff1c88522caea27f5b2ae4d08c5561338507849d3ff01451210d1523e9db2b29","observation_id":"45ff14a3-a57a-43c5-a0bc-a91213b694d2","resolution":{"observed_at":"2026-08-07T05:33:58.315923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:58.725669Z","title":"Toolalpaca: Generalized tool learning for language models with 3000 simulated cases, 2023","venue":null,"work_id":"9286e497-e028-4aea-8d0f-d71d9c1434be","year":2023},"citing_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:58.320088Z"},"links":{"citing_paper":"/paper/2506.07672"},"observation_digest":"sha256:6e1d4e68d76550f5f6bfc31d3ca26caa93ea2f5e0bd70f8a343594afb1735d9d","observation_id":"c7a71f2d-56b2-462e-b732-90c2da61e818","resolution":{"observed_at":"2026-08-07T05:33:58.730639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:58.710700Z","title":"Ducktrack: Multimodal computer agent data collection program","venue":null,"work_id":"dca6ae54-e9ac-445c-8b4f-662e12858314","year":null},"citing_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:58.324118Z"},"links":{"citing_paper":"/paper/2506.07672"},"observation_digest":"sha256:4dc74c78e525b36678cc6f361efd7dcb0e062bf798743a3dfcecc3b396738085","observation_id":"a4699863-2fea-41c4-8fe5-37f1fbd63fdc","resolution":{"observed_at":"2026-08-07T05:33:58.715312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:58.328670Z","title":"Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:58.328670Z"},"links":{"citing_paper":"/paper/2506.07672"},"observation_digest":"sha256:fc9f746de61d130b44ce0c56eb452932be4fcd3cba2f066e1db9a4abe7919270","observation_id":"ba833b08-c98e-4d4f-bc0f-eb9bc662fc39","resolution":{"observed_at":"2026-08-07T05:33:58.328670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:58.686087Z","title":"Understanding the weakness of large language model agents within a complex android environment, 2024","venue":null,"work_id":"99a46259-de4b-44cb-ac7c-511d6c6578a2","year":2024},"citing_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:58.332702Z"},"links":{"citing_paper":"/paper/2506.07672"},"observation_digest":"sha256:960e3143205e1e1bfadcbbadb84e6a1961e23406b1d3493ec671bcbe6967c269","observation_id":"e730522f-7e81-4c82-bba1-6ca642d09022","resolution":{"observed_at":"2026-08-07T05:33:58.690933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:58.670671Z","title":"Androidlab: Training and systematic benchmarking of android autonomous agents, 2024","venue":null,"work_id":"b2fb04d1-0851-4454-9f3f-a1c457313cb2","year":2024},"citing_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:58.337213Z"},"links":{"citing_paper":"/paper/2506.07672"},"observation_digest":"sha256:2444caf94da0cb7118f52cfcba3c95fd9adb15dc0fd9dcd0be5219b6e90deba4","observation_id":"474646de-eea5-41b4-b67c-db4e5196579d","resolution":{"observed_at":"2026-08-07T05:33:58.674983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:58.656299Z","title":"Webshop: Towards scalable real-world web interaction with grounded language agents, 2023","venue":null,"work_id":"5e31ca94-1eb5-478e-b2ca-15d8cdccf011","year":2023},"citing_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:58.341314Z"},"links":{"citing_paper":"/paper/2506.07672"},"observation_digest":"sha256:23b591c59a3de85088f1a6d2c65d3cebb04a3438d32f29c8cb32bd6d38d39d90","observation_id":"e005db5e-41b7-4b9d-b3a4-fb9a643042a1","resolution":{"observed_at":"2026-08-07T05:33:58.660879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:58.345316Z","title":"React: Synergizing reasoning and acting in language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:58.345316Z"},"links":{"citing_paper":"/paper/2506.07672"},"observation_digest":"sha256:60e4672b987d88d72eb3b553d8f9510a21f77b97e6877d0c9e6a7c5252a10151","observation_id":"22a0a3ff-1832-4c9e-8bde-e85a68ae5650","resolution":{"observed_at":"2026-08-07T05:33:58.345316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:58.630902Z","title":"Llamatouch: A faithful and scalable testbed for mobile ui task automation, 2024","venue":null,"work_id":"d766a1b9-84ad-4e6e-a623-2b58dc1aa01c","year":2024},"citing_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:58.349406Z"},"links":{"citing_paper":"/paper/2506.07672"},"observation_digest":"sha256:ae71c1e2795638bbe78fd562ea367b2281666853314378c517d3056da0fc8131","observation_id":"4c438cda-01e8-4b1a-b874-36af2ff0dc53","resolution":{"observed_at":"2026-08-07T05:33:58.635497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:58.616773Z","title":"Agentstudio: A toolkit for building general virtual agents, 2025","venue":null,"work_id":"573e41f6-dbf5-4cdc-bafe-8e95e5a12c2d","year":2025},"citing_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:58.353430Z"},"links":{"citing_paper":"/paper/2506.07672"},"observation_digest":"sha256:9a1372aa3ac04e1f60295cad689b906b377303e9cb55dfe10cd118a345f8cdb5","observation_id":"1911420d-0a32-41f8-8b11-674548479e4c","resolution":{"observed_at":"2026-08-07T05:33:58.621085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:58.357579Z","title":"Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried, Uri Alon, and Graham Neubig","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:58.357579Z"},"links":{"citing_paper":"/paper/2506.07672"},"observation_digest":"sha256:fb938ee6832665fa0c43a1e7596ff2e30e14f47a8199582c29d12cf15819f941","observation_id":"da87977c-51db-4378-a477-d799c90c4f25","resolution":{"observed_at":"2026-08-07T05:33:58.357579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:58.590445Z","title":"source=<path_to_executable_on_host>,target=<path_in_container>,type=bind","venue":null,"work_id":"7b51c0a3-7702-4994-8a3e-7a9e5dcacc9d","year":2023},"citing_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:58.362162Z"},"links":{"citing_paper":"/paper/2506.07672"},"observation_digest":"sha256:4004013bc22af607b7cff9dd81d2f97b9a7ee9bcfb0f8af5b0434fe903b733c0","observation_id":"6cb287dc-b6f9-4df7-bac3-91cbb8dd244d","resolution":{"observed_at":"2026-08-07T05:33:58.594788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:58.575004Z","title":"DISPLAY\")} and use a subshell. For example","venue":null,"work_id":"9f326cb3-5c5a-4933-8045-83ed50aabf1f","year":null},"citing_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:58.367029Z"},"links":{"citing_paper":"/paper/2506.07672"},"observation_digest":"sha256:296560bfc957be0f215406ab54ac94a531acb41ddc6ec904cd1b75071dc4a7af","observation_id":"2ec2dd05-6c23-4b6d-8faa-f99a62b97429","resolution":{"observed_at":"2026-08-07T05:33:58.579848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:58.560573Z","title":null,"venue":null,"work_id":"238d0653-187c-4001-bdfa-06e8a5ff227c","year":null},"citing_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:58.371814Z"},"links":{"citing_paper":"/paper/2506.07672"},"observation_digest":"sha256:ae959dc9b0b8c2780dcafccb6463f287d18eda9af0dafe7f954d9d022c0e13d4","observation_id":"1eca27e5-444e-42ad-8229-e4068b9a56b9","resolution":{"observed_at":"2026-08-07T05:33:58.564809Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:58.544113Z","title":"skip this step","venue":null,"work_id":"d6ea4572-35aa-4daa-9f86-9467c376aa68","year":null},"citing_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:58.376210Z"},"links":{"citing_paper":"/paper/2506.07672"},"observation_digest":"sha256:ed4766f92329ec48ca3f1f0d504dd231f23d84fb9cb9979cb1bb3d6b198d0db4","observation_id":"9ec3d78b-20f1-4852-85f2-81fe9855ceac","resolution":{"observed_at":"2026-08-07T05:33:58.548816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"info/1990296","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:58.507652Z","title":"Translate the selected text in this document to French and save it","venue":null,"work_id":"9c7dbac7-724a-4a59-a34b-22387fa59edf","year":null},"citing_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:58.380468Z"},"links":{"citing_paper":"/paper/2506.07672"},"observation_digest":"sha256:cdc197780425697b3cf54f6654405f04019f9d39b9a978a72d06f18c1f6087e2","observation_id":"68a2b53b-8ad2-41cc-967a-ed7c36ac666a","resolution":{"observed_at":"2026-08-07T05:33:58.517409Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:33:58.528224Z","title":"6 Hard 36 Table 10: List of all tasks inMCPWorld","venue":null,"work_id":"fa7b31fb-8c16-4c00-bb9b-8dcc6e5bebed","year":null},"citing_paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:58.386115Z"},"links":{"citing_paper":"/paper/2506.07672"},"observation_digest":"sha256:53d0af25e4b413aa7c39cff4058ff0d55d269c436f4ef7cf3764d7754c19ca6d","observation_id":"3c11df0d-573b-4c58-89b9-f04efe0b397e","resolution":{"observed_at":"2026-08-07T05:33:58.533481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.07672","last_updated":"2025-06-09T11:50:33Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-17T07:32:52.140440Z","submitted_at":"2025-06-09T11:50:33Z","title":"MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":1,"verified_fuzzy":18},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 12 inbound Pith citation observations for arXiv:2506.07672."}