{"as_of":"2026-08-20T08:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b4346e8e0de5f7717aea0a1a49541446803890b3fe398498f7f4190a453c6d65","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:10:33.820587Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":42,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:15:48.154137Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":2,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-04T11:31:24.596899Z","title":"yes” if you’d like me to move forward with this change. User Yes, please go ahead and downgrade all of them. Tool Call 1{ 2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04491","last_updated":"2026-06-08T20:35:15Z","snapshot_observed_at":"2026-08-19T21:21:07.636464Z","submitted_at":"2025-10-06T05:03:57Z","title":"Impatient Users Confuse AI Agents: High-fidelity Simulations of Human Traits for Testing Agents","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T11:31:24.596899Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2510.04491"},"observation_digest":"sha256:f70cfff94539333c8d851de1195f7492bc84878561544154e16d7efe9ca25476","observation_id":"d2d741c2-0fa2-4e5c-a3c4-086ab17086ed","resolution":{"observed_at":"2026-08-04T11:31:24.596899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-03T09:21:44.317366Z","title":"Mcp-bench: Benchmarking tool-using llm agents with complex real-world tasks via mcp servers.arXiv preprint arXiv:2508.20453, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.14192","last_updated":"2026-07-03T11:26:58Z","snapshot_observed_at":"2026-08-19T21:41:32.258886Z","submitted_at":"2026-01-20T17:51:56Z","title":"Toward Efficient Agents: Memory, Tool learning, and Planning","version":2},"reference_index":136,"source":"pdf_text","source_observed_at":"2026-08-03T09:21:44.317366Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2601.14192"},"observation_digest":"sha256:314e81c9543820406ce71838f96bcd00d71c6960d27e605a496c923ad592bafe","observation_id":"eff51307-cc50-425d-a2df-e6a34fd40fbb","resolution":{"observed_at":"2026-08-03T09:21:44.317366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":"2508.20453","doi":"10.48550/arxiv.2508.20453","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wang et al","venue":"ArXiv.org","work_id":"09a5d0b4-4a61-4a3e-a239-f3d9368305d5","year":2025},"citing_paper":{"arxiv_id":"2602.00933","last_updated":"2026-05-19T23:26:22Z","snapshot_observed_at":"2026-08-13T12:20:20.135004Z","submitted_at":"2026-01-31T23:19:39Z","title":"MCP-Atlas: A Large-Scale Benchmark for Tool-Use Competency with Real MCP Servers","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T08:28:16.904091Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2602.00933"},"observation_digest":"sha256:f4da7f46c68e2c0539684147d064650a368087580147cae56a5849ba2f50055a","observation_id":"46baf4f9-3bca-48b0-bbeb-ba76b3c5ed63","resolution":{"observed_at":"2026-05-16T08:30:45.652708Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":"2508.20453","doi":"10.48550/arxiv.2508.20453","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wang et al","venue":"ArXiv.org","work_id":"09a5d0b4-4a61-4a3e-a239-f3d9368305d5","year":2025},"citing_paper":{"arxiv_id":"2602.00933","last_updated":"2026-05-19T23:26:22Z","snapshot_observed_at":"2026-08-13T12:20:20.135004Z","submitted_at":"2026-01-31T23:19:39Z","title":"MCP-Atlas: A Large-Scale Benchmark for Tool-Use Competency with Real MCP Servers","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T15:10:04.253250Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2602.00933"},"observation_digest":"sha256:9ea783db033f1a6af4bb02806924012b7e99c30146d22a1197f33e5b1be56b8c","observation_id":"2aa53c48-4fa2-402d-8543-40934d1def6a","resolution":{"observed_at":"2026-05-21T15:10:16.430701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":"2508.20453","doi":"10.48550/arxiv.2508.20453","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wang et al","venue":"ArXiv.org","work_id":"09a5d0b4-4a61-4a3e-a239-f3d9368305d5","year":2025},"citing_paper":{"arxiv_id":"2602.11224","last_updated":"2026-04-28T16:08:25Z","snapshot_observed_at":"2026-08-14T01:54:42.029617Z","submitted_at":"2026-02-11T13:31:18Z","title":"Agent-Diff: Benchmarking LLM Agents on Enterprise API Tasks via Code Execution with State-Diff-Based Evaluation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T03:04:17.755968Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2602.11224"},"observation_digest":"sha256:2f12dfe387f7c6375c263aecc1f565284a5bf45d2da388600d929d3f266ac19e","observation_id":"286c9eac-fabc-4c37-843f-12908d1aa990","resolution":{"observed_at":"2026-05-16T03:07:11.549122Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-07-13T15:55:53.399860Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.29139","last_updated":"2026-08-09T04:03:34Z","snapshot_observed_at":"2026-08-16T05:17:14.711870Z","submitted_at":"2026-03-31T01:41:28Z","title":"SciVisAgentBench: A Benchmark for Evaluating Scientific Data Analysis and Visualization Agents","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-13T15:55:53.399860Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2603.29139"},"observation_digest":"sha256:705712745d2dcdb17003faa0b5a4b74d80a5f5e29ac29f350afeb8ff98b2719a","observation_id":"69ff1207-abb2-48e7-8605-fd250ae49fdf","resolution":{"observed_at":"2026-07-13T15:55:53.399860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-02T17:09:18.165636Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.29139","last_updated":"2026-08-09T04:03:34Z","snapshot_observed_at":"2026-08-16T05:17:14.711870Z","submitted_at":"2026-03-31T01:41:28Z","title":"SciVisAgentBench: A Benchmark for Evaluating Scientific Data Analysis and Visualization Agents","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T17:09:18.165636Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2603.29139"},"observation_digest":"sha256:61bab393d9c161f8f425745e003c965b21cb9de5f7f3ce7b7898c24b31fc9fac","observation_id":"406d4e06-13de-4e13-9608-e034324e1fc1","resolution":{"observed_at":"2026-08-02T17:09:18.165636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":"2508.20453","doi":"10.48550/arxiv.2508.20453","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wang et al","venue":"ArXiv.org","work_id":"09a5d0b4-4a61-4a3e-a239-f3d9368305d5","year":2025},"citing_paper":{"arxiv_id":"2604.01532","last_updated":"2026-05-08T22:05:26Z","snapshot_observed_at":"2026-08-03T04:25:49.405977Z","submitted_at":"2026-04-02T02:09:27Z","title":"PHMForge: Evaluating LLM Agents on Industrial Prognostics through MCP-Native, Algorithm-Grounded Tools","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T22:05:25.133535Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2604.01532"},"observation_digest":"sha256:b667cad8455d72332f10a5b521f5444a61def233ae80dcbce025767e55bade26","observation_id":"c94fcd77-d42b-4ef9-9bc4-a0a62f496324","resolution":{"observed_at":"2026-05-13T22:08:20.745113Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":"2508.20453","doi":"10.48550/arxiv.2508.20453","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wang et al","venue":"ArXiv.org","work_id":"09a5d0b4-4a61-4a3e-a239-f3d9368305d5","year":2025},"citing_paper":{"arxiv_id":"2604.07536","last_updated":"2026-04-08T19:18:11Z","snapshot_observed_at":"2026-08-15T07:23:04.232775Z","submitted_at":"2026-04-08T19:18:11Z","title":"TRUSTDESC: Preventing Tool Poisoning in LLM Applications via Trusted Description Generation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-10T17:16:35.875601Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2604.07536"},"observation_digest":"sha256:152f5ee8cbada387e08c91de6f4e34c5d5347b9168c1e44fea443f1a1f94a1e0","observation_id":"eb05c5c6-eb5d-4cb3-8073-2ffe7d1d8e00","resolution":{"observed_at":"2026-05-11T07:10:59.596728Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":"2508.20453","doi":"10.48550/arxiv.2508.20453","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wang et al","venue":"ArXiv.org","work_id":"09a5d0b4-4a61-4a3e-a239-f3d9368305d5","year":2025},"citing_paper":{"arxiv_id":"2604.08523","last_updated":"2026-07-20T17:58:40Z","snapshot_observed_at":"2026-08-17T18:09:30.145825Z","submitted_at":"2026-04-09T17:57:13Z","title":"ClawBench: Can AI Agents Complete Everyday Online Tasks?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T17:34:49.746922Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2604.08523"},"observation_digest":"sha256:0641e9870b6e38a6e259b76e73d26a9789ef079f9aea9e392f4ff406626055f5","observation_id":"e640e963-d1be-458b-a080-81ddf2b6f775","resolution":{"observed_at":"2026-05-11T06:36:01.212806Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-02T16:32:52.060485Z","title":"Mcp-bench: Benchmarking tool-using llm agents with complex real-world tasks via mcp servers.arXiv preprint arXiv:2508.20453,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.08523","last_updated":"2026-07-20T17:58:40Z","snapshot_observed_at":"2026-08-17T18:09:30.145825Z","submitted_at":"2026-04-09T17:57:13Z","title":"ClawBench: Can AI Agents Complete Everyday Online Tasks?","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T16:32:52.060485Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2604.08523"},"observation_digest":"sha256:c0e0eb9c15e7421d0da8d9d0a66d6fa03b183737653d7655615f811c821f3cca","observation_id":"ab85f772-8a3a-4cf3-8cbb-2c66a856ed4c","resolution":{"observed_at":"2026-08-02T16:32:52.060485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":"2508.20453","doi":"10.48550/arxiv.2508.20453","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wang et al","venue":"ArXiv.org","work_id":"09a5d0b4-4a61-4a3e-a239-f3d9368305d5","year":2025},"citing_paper":{"arxiv_id":"2604.10866","last_updated":"2026-04-16T16:00:33Z","snapshot_observed_at":"2026-08-07T11:42:08.308728Z","submitted_at":"2026-04-13T00:27:32Z","title":"OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T16:43:27.037355Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2604.10866"},"observation_digest":"sha256:6818fe5a88435fc9955272550c377ef9d34273b9e25ece0c44e3ee1d9a23dc54","observation_id":"cfdf2bd0-6e26-4321-9851-8e8e7855c463","resolution":{"observed_at":"2026-05-11T08:20:58.062227Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":"2508.20453","doi":"10.48550/arxiv.2508.20453","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wang et al","venue":"ArXiv.org","work_id":"09a5d0b4-4a61-4a3e-a239-f3d9368305d5","year":2025},"citing_paper":{"arxiv_id":"2604.13064","last_updated":"2026-03-19T14:31:22Z","snapshot_observed_at":"2026-08-11T01:08:00.840634Z","submitted_at":"2026-03-19T14:31:22Z","title":"Red Skills or Blue Skills? A Dive Into Skills Published on ClawHub","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T08:33:53.625397Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2604.13064"},"observation_digest":"sha256:ec53a5e183cfdf665e5f3e800a6a252cbf72104442abe28d92f22534aa41e865","observation_id":"75d019a0-c510-465d-b6e3-a24a3bd23997","resolution":{"observed_at":"2026-05-15T08:35:18.555855Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":"2508.20453","doi":"10.48550/arxiv.2508.20453","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wang et al","venue":"ArXiv.org","work_id":"09a5d0b4-4a61-4a3e-a239-f3d9368305d5","year":2025},"citing_paper":{"arxiv_id":"2604.17234","last_updated":"2026-04-19T03:38:10Z","snapshot_observed_at":"2026-08-14T09:10:58.720945Z","submitted_at":"2026-04-19T03:38:10Z","title":"From Language to Action: Enhancing LLM Task Efficiency with Task-Aware MCP Server Recommendation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T06:20:49.799989Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2604.17234"},"observation_digest":"sha256:e108d342c72319ccc24345df2824b454f567b87273c85072a2ee8732012a2136","observation_id":"60a979af-a4ee-4817-95a8-ca09a4324b91","resolution":{"observed_at":"2026-05-10T06:21:26.782566Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":"2508.20453","doi":"10.48550/arxiv.2508.20453","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wang et al","venue":"ArXiv.org","work_id":"09a5d0b4-4a61-4a3e-a239-f3d9368305d5","year":2025},"citing_paper":{"arxiv_id":"2604.19657","last_updated":"2026-04-21T16:45:30Z","snapshot_observed_at":"2026-08-13T13:06:09.080226Z","submitted_at":"2026-04-21T16:45:30Z","title":"An AI Agent Execution Environment to Safeguard User Data","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-10T02:14:40.639143Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2604.19657"},"observation_digest":"sha256:9081329ac3443ebd37ba9959abf3f4748838c91a290ecb76efb0f2c5a185089c","observation_id":"3330379a-2427-464b-8fe1-0de32ec37c99","resolution":{"observed_at":"2026-05-11T13:11:05.854051Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":"2508.20453","doi":"10.48550/arxiv.2508.20453","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wang et al","venue":"ArXiv.org","work_id":"09a5d0b4-4a61-4a3e-a239-f3d9368305d5","year":2025},"citing_paper":{"arxiv_id":"2604.23781","last_updated":"2026-05-05T15:32:46Z","snapshot_observed_at":"2026-08-11T16:55:35.527958Z","submitted_at":"2026-04-26T16:05:02Z","title":"ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T06:36:52.202847Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2604.23781"},"observation_digest":"sha256:6decd28c498db0b003f205196c8e09b6e82d5f0c5297384b7fe5547994982cf7","observation_id":"df550c02-dd52-459a-aed6-c25951f65292","resolution":{"observed_at":"2026-05-11T21:11:10.779830Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":"2508.20453","doi":"10.48550/arxiv.2508.20453","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wang et al","venue":"ArXiv.org","work_id":"09a5d0b4-4a61-4a3e-a239-f3d9368305d5","year":2025},"citing_paper":{"arxiv_id":"2604.28139","last_updated":"2026-05-01T09:39:37Z","snapshot_observed_at":"2026-08-19T11:26:55.966201Z","submitted_at":"2026-04-30T17:23:19Z","title":"Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-07T05:52:13.100867Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2604.28139"},"observation_digest":"sha256:af916703526d8347c6041cc98f45f01f935fec4ced363ce2ed4f35914eaffafc","observation_id":"8abc306b-5faa-49d8-82b3-e66dafa5c7c1","resolution":{"observed_at":"2026-05-12T10:31:29.155151Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":"2508.20453","doi":"10.48550/arxiv.2508.20453","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wang et al","venue":"ArXiv.org","work_id":"09a5d0b4-4a61-4a3e-a239-f3d9368305d5","year":2025},"citing_paper":{"arxiv_id":"2605.02240","last_updated":"2026-05-04T05:32:25Z","snapshot_observed_at":"2026-08-18T08:43:28.232129Z","submitted_at":"2026-05-04T05:32:25Z","title":"PhysicianBench: Evaluating LLM Agents in Real-World EHR Environments","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-09T16:36:39.233362Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2605.02240"},"observation_digest":"sha256:7d32b3295364dcf4edceb486f896905aa48cfa1798748a2a99bf446d855fc30f","observation_id":"40abeb55-a060-4076-aac7-4e3cd301c835","resolution":{"observed_at":"2026-05-11T16:31:06.500219Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":"2508.20453","doi":"10.48550/arxiv.2508.20453","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wang et al","venue":"ArXiv.org","work_id":"09a5d0b4-4a61-4a3e-a239-f3d9368305d5","year":2025},"citing_paper":{"arxiv_id":"2605.07926","last_updated":"2026-05-20T12:32:44Z","snapshot_observed_at":"2026-08-15T01:19:24.116643Z","submitted_at":"2026-05-08T15:59:27Z","title":"AgentEscapeBench: Evaluating Out-of-Domain Tool-Grounded Reasoning in LLM Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-11T03:31:57.068492Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2605.07926"},"observation_digest":"sha256:491846e91effd0a266f6ec1ede821081dc5d0336bbfdd2447cd9c20b311b3213","observation_id":"0f1fecb5-43f2-4630-8640-01b7f72fc847","resolution":{"observed_at":"2026-05-11T03:40:54.001965Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":"2508.20453","doi":"10.48550/arxiv.2508.20453","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wang et al","venue":"ArXiv.org","work_id":"09a5d0b4-4a61-4a3e-a239-f3d9368305d5","year":2025},"citing_paper":{"arxiv_id":"2605.07926","last_updated":"2026-05-20T12:32:44Z","snapshot_observed_at":"2026-08-15T01:19:24.116643Z","submitted_at":"2026-05-08T15:59:27Z","title":"AgentEscapeBench: Evaluating Out-of-Domain Tool-Grounded Reasoning in LLM Agents","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T07:59:38.911667Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2605.07926"},"observation_digest":"sha256:57ea4d241ca4921ad198834184df030ed859509579242a1dfe360528bd166f42","observation_id":"903350c3-bb02-499d-a1a1-783dacabfeeb","resolution":{"observed_at":"2026-05-21T07:59:50.066435Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":"2508.20453","doi":"10.48550/arxiv.2508.20453","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wang et al","venue":"ArXiv.org","work_id":"09a5d0b4-4a61-4a3e-a239-f3d9368305d5","year":2025},"citing_paper":{"arxiv_id":"2605.10787","last_updated":"2026-05-20T01:39:17Z","snapshot_observed_at":"2026-08-12T22:55:54.365434Z","submitted_at":"2026-05-11T16:20:51Z","title":"ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-12T04:42:47.496496Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2605.10787"},"observation_digest":"sha256:05d0e78026288c504a719d14496c0d34b492c491a52e0a3bb687464d9ddabe92","observation_id":"9aed00ff-1add-4a6e-b59b-6d6afda7ab50","resolution":{"observed_at":"2026-05-12T06:01:23.539497Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":"2508.20453","doi":"10.48550/arxiv.2508.20453","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wang et al","venue":"ArXiv.org","work_id":"09a5d0b4-4a61-4a3e-a239-f3d9368305d5","year":2025},"citing_paper":{"arxiv_id":"2605.10787","last_updated":"2026-05-20T01:39:17Z","snapshot_observed_at":"2026-08-12T22:55:54.365434Z","submitted_at":"2026-05-11T16:20:51Z","title":"ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-21T08:08:04.544564Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2605.10787"},"observation_digest":"sha256:d70aba45f602728e521a83559b3ddd8d342e63ba3a8a19f87b7a778617452313","observation_id":"7fbcf87d-e43d-4bf5-b616-d1fef4bc1c42","resolution":{"observed_at":"2026-05-21T08:09:51.241818Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":"2508.20453","doi":"10.48550/arxiv.2508.20453","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wang et al","venue":"ArXiv.org","work_id":"09a5d0b4-4a61-4a3e-a239-f3d9368305d5","year":2025},"citing_paper":{"arxiv_id":"2605.10912","last_updated":"2026-05-11T17:49:43Z","snapshot_observed_at":"2026-08-11T19:02:22.870997Z","submitted_at":"2026-05-11T17:49:43Z","title":"WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T03:40:00.725327Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2605.10912"},"observation_digest":"sha256:1ddff3b2ff506b8c19c2fdba950b6fac90175a7830a661ba1c71629db00992ac","observation_id":"cdb5c22d-e16d-4a8d-9190-ad25c21b077d","resolution":{"observed_at":"2026-05-12T07:11:24.094059Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":"2508.20453","doi":"10.48550/arxiv.2508.20453","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wang et al","venue":"ArXiv.org","work_id":"09a5d0b4-4a61-4a3e-a239-f3d9368305d5","year":2025},"citing_paper":{"arxiv_id":"2605.15104","last_updated":"2026-05-20T10:20:54Z","snapshot_observed_at":"2026-07-06T23:26:28.006734Z","submitted_at":"2026-05-14T17:22:42Z","title":"From Text to Voice: A Reproducible and Verifiable Framework for Evaluating Tool Calling LLM Agents","version":2},"reference_index":270,"source":"arxiv_source","source_observed_at":"2026-05-21T08:45:56.550821Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2605.15104"},"observation_digest":"sha256:951c9986fc30f6f5ac2472591c65efa8465f1020bae22e6c9e212e2595a404ac","observation_id":"bea7fd16-a9b7-4cbc-8c34-207c32d856fa","resolution":{"observed_at":"2026-05-21T08:49:53.688210Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":"2508.20453","doi":"10.48550/arxiv.2508.20453","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wang et al","venue":"ArXiv.org","work_id":"09a5d0b4-4a61-4a3e-a239-f3d9368305d5","year":2025},"citing_paper":{"arxiv_id":"2605.16909","last_updated":"2026-05-16T09:49:25Z","snapshot_observed_at":"2026-08-15T14:15:47.623703Z","submitted_at":"2026-05-16T09:49:25Z","title":"TOBench: A Task-Oriented Omni-Modal Benchmark for Real-World Tool-Using Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T20:43:16.364125Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2605.16909"},"observation_digest":"sha256:9bfa67ea46c49b06f7f76ba449e8cfa2b9357bf6793fd32873e14b82216037cf","observation_id":"d2e42a51-9fd7-4a7e-99ab-9d6477bc2f49","resolution":{"observed_at":"2026-05-19T20:47:45.988091Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":"2508.20453","doi":"10.48550/arxiv.2508.20453","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wang et al","venue":"ArXiv.org","work_id":"09a5d0b4-4a61-4a3e-a239-f3d9368305d5","year":2025},"citing_paper":{"arxiv_id":"2605.30785","last_updated":"2026-05-29T03:21:08Z","snapshot_observed_at":"2026-08-05T20:36:37.425094Z","submitted_at":"2026-05-29T03:21:08Z","title":"Learning Agent-Compatible Context Management for Long-Horizon Tasks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T22:35:40.724644Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2605.30785"},"observation_digest":"sha256:d61d56be1347c9fd1bb7a7ae1dc6b729d94e10afbe49330864926f42c0f18a10","observation_id":"8c021193-60c9-4b97-bd8c-a1ba5860f75c","resolution":{"observed_at":"2026-06-28T22:42:47.091491Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":"2508.20453","doi":"10.48550/arxiv.2508.20453","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wang et al","venue":"ArXiv.org","work_id":"09a5d0b4-4a61-4a3e-a239-f3d9368305d5","year":2025},"citing_paper":{"arxiv_id":"2605.31308","last_updated":"2026-05-29T13:40:31Z","snapshot_observed_at":"2026-08-12T05:08:41.357141Z","submitted_at":"2026-05-29T13:40:31Z","title":"TraceGraph: Shared Decision Landscapes for Diagnosing and Improving Agent Trajectories","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T22:22:54.473952Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2605.31308"},"observation_digest":"sha256:653d85b7bef63c0c2c2f12ae2ee46c081d3d0bd6baf2e21711b26e488d71864f","observation_id":"25a4c94b-170b-4375-bda1-acf03394c30e","resolution":{"observed_at":"2026-07-01T19:36:08.584297Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":"2508.20453","doi":"10.48550/arxiv.2508.20453","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wang et al","venue":"ArXiv.org","work_id":"09a5d0b4-4a61-4a3e-a239-f3d9368305d5","year":2025},"citing_paper":{"arxiv_id":"2606.09182","last_updated":"2026-06-08T08:20:50Z","snapshot_observed_at":"2026-08-03T16:53:51.333365Z","submitted_at":"2026-06-08T08:20:50Z","title":"Understanding How Enterprises Adopt the Model Context Protocol for LLM-Driven Software Engineering","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T15:48:39.837630Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2606.09182"},"observation_digest":"sha256:1f8eb97652d17a7dcb387cd115e29e9427f5b99a9cf8be235e59a14b10871d01","observation_id":"8badc2b7-429d-4466-b384-c0f303ee85e3","resolution":{"observed_at":"2026-07-03T02:37:34.622928Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":"2508.20453","doi":"10.48550/arxiv.2508.20453","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wang et al","venue":"ArXiv.org","work_id":"09a5d0b4-4a61-4a3e-a239-f3d9368305d5","year":2025},"citing_paper":{"arxiv_id":"2606.10209","last_updated":"2026-06-08T22:01:28Z","snapshot_observed_at":"2026-08-14T13:19:36.637941Z","submitted_at":"2026-06-08T22:01:28Z","title":"Less Context, Better Agents: Efficient Context Engineering for Long-Horizon Tool-Using LLM Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T16:10:25.191306Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2606.10209"},"observation_digest":"sha256:6f9d98553b778e4e1ab2d987c27b4104e6a8c6b3355fb7222f25ede85e0ac429","observation_id":"2464d5ee-ddc1-41fd-b7df-40499aa65895","resolution":{"observed_at":"2026-07-03T02:07:33.608185Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":"2508.20453","doi":"10.48550/arxiv.2508.20453","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wang et al","venue":"ArXiv.org","work_id":"09a5d0b4-4a61-4a3e-a239-f3d9368305d5","year":2025},"citing_paper":{"arxiv_id":"2606.12191","last_updated":"2026-06-10T15:15:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-10T15:15:01Z","title":"Agentic Environment Engineering for Large Language Models: A Survey of Environment Modeling, Synthesis, Evaluation, and Application","version":1},"reference_index":136,"source":"pdf_text","source_observed_at":"2026-06-27T09:46:30.702256Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2606.12191"},"observation_digest":"sha256:19162a50dd9881b8b19f903d0964aa056e07d4a6735dfa7844a70b425847cd9d","observation_id":"a203ab98-fb02-4f59-80ac-3d462739b0ae","resolution":{"observed_at":"2026-06-27T09:50:48.561027Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":"2508.20453","doi":"10.48550/arxiv.2508.20453","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wang et al","venue":"ArXiv.org","work_id":"09a5d0b4-4a61-4a3e-a239-f3d9368305d5","year":2025},"citing_paper":{"arxiv_id":"2606.12674","last_updated":"2026-06-10T21:01:06Z","snapshot_observed_at":"2026-08-17T10:53:16.195794Z","submitted_at":"2026-06-10T21:01:06Z","title":"Evoflux: Inference-Time Evolution of Executable Tool Workflows for Compact Agents","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-27T09:46:59.954720Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2606.12674"},"observation_digest":"sha256:870fedf36ef20f3c9c79bcca3d1172de953654d5e7b58b75c09f8ff8e25452fd","observation_id":"788aed7a-ae90-4f74-9b33-0b1d6029b8cf","resolution":{"observed_at":"2026-06-27T09:50:48.180694Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":"2508.20453","doi":"10.48550/arxiv.2508.20453","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wang et al","venue":"ArXiv.org","work_id":"09a5d0b4-4a61-4a3e-a239-f3d9368305d5","year":2025},"citing_paper":{"arxiv_id":"2606.12908","last_updated":"2026-06-11T05:06:50Z","snapshot_observed_at":"2026-08-12T14:52:30.848387Z","submitted_at":"2026-06-11T05:06:50Z","title":"SENTINEL: Failure-Driven Reinforcement Learning for Training Tool-Using Language Model Agents","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-06-27T06:49:12.070481Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2606.12908"},"observation_digest":"sha256:014988d3ebe05b15a3e300a1dc6b4ee84765b298656224955bdba0e1c13e474f","observation_id":"d231a8d5-b126-446b-b7d3-f621bb37afd0","resolution":{"observed_at":"2026-07-03T14:58:33.183784Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":"2508.20453","doi":"10.48550/arxiv.2508.20453","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wang et al","venue":"ArXiv.org","work_id":"09a5d0b4-4a61-4a3e-a239-f3d9368305d5","year":2025},"citing_paper":{"arxiv_id":"2606.16591","last_updated":"2026-06-16T09:43:21Z","snapshot_observed_at":"2026-08-17T04:06:09.468519Z","submitted_at":"2026-06-15T11:37:37Z","title":"SING: Synthetic Intention Graph for Scalable Active Tool Discovery in LLM Agents","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T03:57:49.824752Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2606.16591"},"observation_digest":"sha256:23727711aea34cbeb71045563a483a720e175fb38aac8d35e502efe9be2d4c65","observation_id":"f479b467-f481-42fa-96cf-e5840189294d","resolution":{"observed_at":"2026-07-03T17:38:43.983786Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":"2508.20453","doi":"10.48550/arxiv.2508.20453","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wang et al","venue":"ArXiv.org","work_id":"09a5d0b4-4a61-4a3e-a239-f3d9368305d5","year":2025},"citing_paper":{"arxiv_id":"2606.17819","last_updated":"2026-06-16T11:46:56Z","snapshot_observed_at":"2026-08-15T18:27:32.114818Z","submitted_at":"2026-06-16T11:46:56Z","title":"A Framework for Evaluating Agentic Skills at Scale","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-26T23:42:37.325511Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2606.17819"},"observation_digest":"sha256:1124dc578e676ae660e2cd7a9d28f5970ea8210c26652cb9625085ae435ee07a","observation_id":"a807c3dd-2474-4f86-9153-3be678c00937","resolution":{"observed_at":"2026-07-03T22:08:59.871322Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":"2508.20453","doi":"10.48550/arxiv.2508.20453","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wang et al","venue":"ArXiv.org","work_id":"09a5d0b4-4a61-4a3e-a239-f3d9368305d5","year":2025},"citing_paper":{"arxiv_id":"2606.22385","last_updated":"2026-06-21T08:22:23Z","snapshot_observed_at":"2026-08-01T18:23:09.613202Z","submitted_at":"2026-06-21T08:22:23Z","title":"MetaPS: Adaptive Programmatic Strategy Selection for Market Agents","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-06-26T11:06:28.690956Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2606.22385"},"observation_digest":"sha256:4536b3165ae2430444735b7c3509c44964a07b6d67d000f8383cc9726a54bd4f","observation_id":"93786827-d764-451e-89db-70b0e90cf7e0","resolution":{"observed_at":"2026-07-04T08:39:42.675663Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-01T19:19:04.089748Z","title":"MCP-Bench: Benchmarking tool-using LLM agents with complex real-world tasks via Model Context Protocol servers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17012","last_updated":"2026-07-19T00:16:24Z","snapshot_observed_at":"2026-08-18T22:48:31.511367Z","submitted_at":"2026-07-19T00:16:24Z","title":"Schema-Bound LLM Control of Scientific Instrumentation through Model Context Protocol Skills","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T19:19:04.089748Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2607.17012"},"observation_digest":"sha256:8b59f307934ff1703b6d3c3fa25f579784eb3b021334da5d1cb9ea48f1dd461a","observation_id":"1ae63b55-b590-48dc-99f1-b2d020685d3d","resolution":{"observed_at":"2026-08-01T19:19:04.089748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-02T07:42:13.260641Z","title":"arXiv preprint arXiv:2508.20453","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20531","last_updated":"2026-07-10T12:25:57Z","snapshot_observed_at":"2026-08-15T15:00:13.700533Z","submitted_at":"2026-07-10T12:25:57Z","title":"DynamicMCPBench: A Trace-Grounded, Effect-Scored Benchmark for LLM Agents over Live MCP Servers","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T07:42:13.260641Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2607.20531"},"observation_digest":"sha256:6ebd87798db45443a9aacf9f29d2285f0967961faef9004dc2ef67626eb06d6b","observation_id":"320fd98c-1383-4460-8d03-d7f05237fe76","resolution":{"observed_at":"2026-08-02T07:42:13.260641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-07-31T23:34:44.796574Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23933","last_updated":"2026-08-05T01:08:13Z","snapshot_observed_at":"2026-08-11T17:00:23.884355Z","submitted_at":"2026-07-27T02:10:35Z","title":"SpecBox: Speculative Sandbox Scheduling for Efficient LLM Agent Serving","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-31T23:34:44.796574Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2607.23933"},"observation_digest":"sha256:7a45e2e22affbf341329ff35d89c5e7cda656947dd532dd70b6737510d567408","observation_id":"5adf52ae-058d-4dfc-93c6-95c17fc42961","resolution":{"observed_at":"2026-07-31T23:34:44.796574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-01T01:16:41.424525Z","title":"arXiv preprint arXiv:2508.20453 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:41.424525Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:ab527fdec733d79f246afec89e317f3367f91b2a6df02f0d143da732b6946cbd","observation_id":"b5a9827f-7b4c-4ecd-8acb-40f1444fed33","resolution":{"observed_at":"2026-08-01T01:16:41.424525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-04T22:55:33.992939Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01684","last_updated":"2026-08-03T04:18:31Z","snapshot_observed_at":"2026-08-17T14:05:08.138252Z","submitted_at":"2026-08-03T04:18:31Z","title":"GABench: A Comprehensive Benchmark for Evaluating LLM Agents on Graph Analysis Tasks","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:33.992939Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2608.01684"},"observation_digest":"sha256:fd4e6caee977c08fe007e62cb889ee7ed9d49ade869d53cc81306915eda9485d","observation_id":"98547dcf-eb3a-4191-aa38-35cf4adbfef4","resolution":{"observed_at":"2026-08-04T22:55:33.992939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-15T14:16:35.510996Z","title":"Mcp-bench: Benchmarking tool-using llm agents with complex real-world tasks via mcp servers, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11386","last_updated":"2026-08-11T19:50:56Z","snapshot_observed_at":"2026-08-19T09:05:50.511243Z","submitted_at":"2026-08-11T19:50:56Z","title":"The Devil Is in the Interface: Evaluating How Tool Architecture Shapes Coding Agent Behavior","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:35.510996Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2608.11386"},"observation_digest":"sha256:0361dee7affc7d011964e181e2881c92febccac916138be53380a5f4e7a4b0e0","observation_id":"0a0dafa6-69d1-4a9c-a8be-acef5616beac","resolution":{"observed_at":"2026-08-15T14:16:35.510996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20453","snapshot_observed_at":"2026-08-16T00:15:48.154137Z","title":"arXiv preprint arXiv:2508.20453","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12282","last_updated":"2026-08-12T17:27:27Z","snapshot_observed_at":"2026-08-19T07:44:15.322966Z","submitted_at":"2026-08-12T17:27:27Z","title":"VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:15:48.154137Z"},"links":{"cited_paper":"/paper/2508.20453","citing_paper":"/paper/2608.12282"},"observation_digest":"sha256:066bd59b9b0605426407596acfe5e520ee3f33669e2ccd9583ea1c0bfaf63674","observation_id":"eb54e9e3-c2c9-4565-9de7-17caffeff54a","resolution":{"observed_at":"2026-08-16T00:15:48.154137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.20453/citation-record","integrity":"/paper/2508.20453/integrity","json":"/paper/2508.20453/citation-record.json","paper":"/paper/2508.20453"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.695466Z","title":null,"venue":null,"work_id":"78550270-d455-4e72-9640-cd66fb452b33","year":null},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.615257Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:e5d8132c00e99fae8a521c04ab1a70b261463d46aa156edc41d7b30ed916f69e","observation_id":"9bc495f9-5096-438d-ac3a-b4a7869698ea","resolution":{"observed_at":"2026-08-05T15:10:34.701232Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.677929Z","title":null,"venue":null,"work_id":"d74f0567-5386-48de-85f6-7d4d760a316a","year":null},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.621206Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:40e9c6d03b608dfcd01d53f72a57f88d91ea3cc99bcabbc7050f5f4fb8685317","observation_id":"517b534e-b9a3-442d-9b7a-6b2678e54196","resolution":{"observed_at":"2026-08-05T15:10:34.683309Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.656117Z","title":"reasoning","venue":null,"work_id":"0dc822de-9aba-4c61-8028-0bd813eec4f9","year":null},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.626807Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:01374afd48d9a5339592837806c1f22735cff53dd408c5776f4c6b956d48044c","observation_id":"1ef0164f-c67e-4be0-9f6f-229c2c10f21a","resolution":{"observed_at":"2026-08-05T15:10:34.665049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.636775Z","title":null,"venue":null,"work_id":"5789c229-c0f3-4f02-b828-78fd7279ff40","year":null},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.632885Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:ed3d58fecd6d82f0b9bfa87b2c75ae73dfcde0838f1fa6e46107aebb73c9e981","observation_id":"59250d59-a07f-4ea4-84b4-cc81ad11d68a","resolution":{"observed_at":"2026-08-05T15:10:34.642526Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.617293Z","title":"https://api.example.com","venue":null,"work_id":"2669b49f-c351-403c-a836-fa5c08ba8025","year":null},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.641177Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:e41b95c92bcdb2871c8824c2fb094afe0f324ae5b38a5cb6b2e60929ecb45550","observation_id":"528d9cbd-5314-4cc2-b65c-10b96f729e9e","resolution":{"observed_at":"2026-08-05T15:10:34.622811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.595740Z","title":null,"venue":null,"work_id":"3ba9db76-3c36-4835-b573-8f5de37bc60a","year":null},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.647229Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:a7be74e714ef818705a96f2a3d0d53832376aa904298e2514b6f9dd26d740107","observation_id":"78d07faa-19d6-47fc-9670-1a83c847ac40","resolution":{"observed_at":"2026-08-05T15:10:34.601838Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.572550Z","title":"user-provided parameters","venue":null,"work_id":"528fe8f3-c7dc-45a6-b8a9-4b8c38ff5705","year":null},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.653173Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:8b6357d3df4d520fe6201c63cb07fb4675afeade1122c4d792fa103e65ef9665","observation_id":"23bd3417-2427-4b70-8a10-eaf8279c7e66","resolution":{"observed_at":"2026-08-05T15:10:34.581366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.548719Z","title":"analyze heat exchanger with inlet temp 80°C, outlet 60°C, flow rate 0.5 kg/s","venue":null,"work_id":"85feac08-c00d-4a0e-b178-1e345efd93c1","year":2024},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.659112Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:165f4e15dcac87c7d8a00c16b8845f5b8229032d200a70679df8a117e80f06b1","observation_id":"8cd65c99-0706-4587-be93-f3f1d03249d5","resolution":{"observed_at":"2026-08-05T15:10:34.555841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.528313Z","title":null,"venue":null,"work_id":"c0231629-54ab-4470-a359-e59212a0fc33","year":null},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.665761Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:0e1a82fe24dfa42c475100b88a3135415d6f1b25498309a63b2ff3977c79537a","observation_id":"57b15ac7-158d-4368-8e3f-5c3f96e6ae9c","resolution":{"observed_at":"2026-08-05T15:10:34.533889Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.508787Z","title":null,"venue":null,"work_id":"c143a3a7-eaa0-4647-968d-2f5bf7cb785e","year":null},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.671267Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:7e2b11c86e73f27393df42216ced64c388c4a6e0cef1e09b882f8c887891a617","observation_id":"1790129b-fa6a-4642-9e2b-80053fca5f07","resolution":{"observed_at":"2026-08-05T15:10:34.515146Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.484976Z","title":null,"venue":null,"work_id":"0b990a77-9a27-4058-b40f-115d65182199","year":null},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.676661Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:67160c2629f7e0c64f1c435ebaa8f66f3e77094d9b8e2add96dde792d472b64d","observation_id":"d6adb6cf-595f-4170-88db-99f0b4433311","resolution":{"observed_at":"2026-08-05T15:10:34.492456Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.465040Z","title":null,"venue":null,"work_id":"db72263d-3ebd-4cfe-a642-6dfe43f3aa63","year":null},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.681825Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:dad7198667825c5862a90e7c5b87b4f50079273859ae2efb3aeba48685b06338","observation_id":"1372f17d-f36b-460f-94e0-dffd1152f029","resolution":{"observed_at":"2026-08-05T15:10:34.470651Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.441024Z","title":null,"venue":null,"work_id":"a7cd207e-fa10-4f48-aeb8-65ac4148b576","year":null},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.687741Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:d5e1075b788427eae669d44811d35e02b84cac3b7f587d4114186424767f2203","observation_id":"bb21d547-d497-40db-b354-29512c256d14","resolution":{"observed_at":"2026-08-05T15:10:34.448645Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.416873Z","title":null,"venue":null,"work_id":"524dc63c-5bf8-45e8-bd4f-e894e1bd7331","year":null},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.692862Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:a9fdf26bc8b4aa0c199e2533afa7858279495661fb5839f23ed0e5a090859e97","observation_id":"8ebca78d-3568-4bdd-a5d6-6ee5d3f6cb02","resolution":{"observed_at":"2026-08-05T15:10:34.423036Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.392002Z","title":null,"venue":null,"work_id":"1e0654e2-e5a2-4d7a-aac8-109c927537cb","year":null},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.697758Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:420244383f4271484516cff5c6d45a3fb96dd6f718990b446388bc235b54a742","observation_id":"e9c19ae7-dd75-464c-bd82-dbdd836a5dc6","resolution":{"observed_at":"2026-08-05T15:10:34.398304Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.354447Z","title":"task_id\":","venue":null,"work_id":"99e8767c-29da-4e64-95eb-7ff309506120","year":null},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.703063Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:8141cd36da6f5b38c12811dcfe43aea4ab08088aeeca85aab7fc792122179563","observation_id":"191de8d9-b0e6-4fbe-b5bb-440e6ffc30c6","resolution":{"observed_at":"2026-08-05T15:10:34.365396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.327914Z","title":null,"venue":null,"work_id":"a15270bf-1e82-44c4-97af-00b5ad79bfca","year":null},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.708300Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:4325b2ce807659763f4f36a44fcb53ce822c8f95ced94ecf43261eae999376ec","observation_id":"54bdbb50-28ba-422f-9e73-11c8ca716b70","resolution":{"observed_at":"2026-08-05T15:10:34.335491Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.301851Z","title":"solvability_score","venue":null,"work_id":"0c751f34-4062-4f0c-89c0-61c4301aa57a","year":2024},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.713531Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:1a3213400d9007c0425972f3173392546c326cf2ddd607ebc8c87eec7dab3d88","observation_id":"80416348-174b-4867-9ac2-43595f127855","resolution":{"observed_at":"2026-08-05T15:10:34.308068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.280627Z","title":"• 4–6: Perfectly completes 40–60% of requirements","venue":null,"work_id":"5c39a657-45ff-4434-aeac-d5cbedd19385","year":null},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.719000Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:bcb6d893beab433e6cb61a8314fc050c97404238df30b6b3009ccbc760f9964f","observation_id":"c46a3000-b3b4-412d-bc96-7764805e3115","resolution":{"observed_at":"2026-08-05T15:10:34.286957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.257862Z","title":"• 4–6: 40–60% of claims are perfectly grounded in tool outputs","venue":null,"work_id":"dc5307e8-e96b-4374-86ca-2f57c9bf7195","year":null},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.723985Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:7fd84ee87a520dc909de68cf75a21a4970def14335e72f56f126250646340894","observation_id":"88ca05a6-0557-4962-a34b-2eabfc03f57c","resolution":{"observed_at":"2026-08-05T15:10:34.265634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.234092Z","title":"• 4–6: 40–60% of tools were perfectly selected for their subtasks","venue":null,"work_id":"8028ea0a-5b14-47e6-a723-ffde8562ff7c","year":null},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.730077Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:0c8567f63b360be82634c728f6a4fdeb8030487816582d1d634b694e22aa143a","observation_id":"a66308a0-12ab-4856-a3e9-3f1a49ffae1e","resolution":{"observed_at":"2026-08-05T15:10:34.241211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.206405Z","title":"• 4–6: 40–60% of tool calls have perfectly accurate and complete parameters","venue":null,"work_id":"411cf8d4-2c43-41fe-9e10-531b2c27789b","year":null},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.735441Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:5f2ec368b69b7679a97cf5d66ca546fe48fc9c120ae27238b8997977d0cc5173","observation_id":"1cf167a0-13e8-4e19-a005-3ab9b6300076","resolution":{"observed_at":"2026-08-05T15:10:34.213497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.182965Z","title":"• 4–6: 40–60% of dependency chains are perfectly executed","venue":null,"work_id":"0b07dfb4-3f9f-42f0-88ea-7dac56842962","year":null},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.740724Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:e6a3eb0b58814906eca16e0401ce2b0066375acb6a9c86dcf908543bd2c21228","observation_id":"7956d996-f281-451a-8ce2-676f165273e9","resolution":{"observed_at":"2026-08-05T15:10:34.190093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.163647Z","title":"• 4–6: 40–60% redundant calls OR 40–60% of parallelizable tasks were executed in parallel","venue":null,"work_id":"4928693b-6c19-49c2-b71f-1499e93e4089","year":null},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.745864Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:05ac7d00c64527472d04b6dd01d962004350f9030c679cef30d582a51f84732d","observation_id":"b8149200-9703-4a4e-b572-54232f00cb9b","resolution":{"observed_at":"2026-08-05T15:10:34.170666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.144335Z","title":"perfectly executed","venue":null,"work_id":"1818129b-2851-47c5-b28f-162331a6dea5","year":null},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.751663Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:e3c40181e1645d97563f37e32389661be0dc9793ba0594295905b306a5557d2f","observation_id":"bc2b8a19-d205-4df6-beeb-68292ce0707b","resolution":{"observed_at":"2026-08-05T15:10:34.150979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.120313Z","title":"Perfectly","venue":null,"work_id":"f9a0b61e-d6c4-4d16-90a0-1a92949911ce","year":null},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.757556Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:3add5789391725e854f2cf819651c50d02c804e3d66221bb5115cf8bebc50007","observation_id":"45fca52c-9699-4f1b-b492-78f37f9aaa52","resolution":{"observed_at":"2026-08-05T15:10:34.126997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.098136Z","title":null,"venue":null,"work_id":"07a9fdb5-d59d-4411-a42f-c59a1f75e1b6","year":null},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.764098Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:5680e5309813f211090f06b233b437950fe6686615141a31edf24c41e700087b","observation_id":"cc0e7a3e-0e15-484d-a062-a620d4617d8d","resolution":{"observed_at":"2026-08-05T15:10:34.105165Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.078397Z","title":null,"venue":null,"work_id":"ac3ca8d8-b30f-4a69-9ca9-e06270ddcdbb","year":null},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.770170Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:385a39ceb966115eceb01cdf01cce9f3c2bbfb8849217f5045c5e8d239d31aa7","observation_id":"6a8a78ee-8a7d-4de5-bd29-a6f43119e7cd","resolution":{"observed_at":"2026-08-05T15:10:34.084014Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.050595Z","title":null,"venue":null,"work_id":"a7792a3f-b3bf-401e-8c95-ce6a45a03de0","year":null},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.776835Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:7a95f28098837cfe17cbb9c5bed4720739c18ab721e46c481fc13c8c737072e3","observation_id":"62dc9ffd-2480-4f9b-94ff-0758673e90ab","resolution":{"observed_at":"2026-08-05T15:10:34.061251Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.030454Z","title":null,"venue":null,"work_id":"64889783-d532-4d64-857c-d864b12addd0","year":null},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.782065Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:09835e54314ce420bae5cd3725af7ea5b81c26224bda35007e6a707dc738855b","observation_id":"0fd39ded-4035-42fb-bba7-a078754f890f","resolution":{"observed_at":"2026-08-05T15:10:34.036228Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.007562Z","title":null,"venue":null,"work_id":"5a7ac7a2-abce-4946-8ba3-8b70b1d60968","year":null},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.788104Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:431ed1694feebea64e1f4d4c31fae24c2372abbe3d2affbf50d23925571f1ca8","observation_id":"9f6d5ffa-002d-4447-bfe3-64748952fde0","resolution":{"observed_at":"2026-08-05T15:10:34.015983Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:33.982971Z","title":"perfectly executed","venue":null,"work_id":"6c35a3c2-2eda-4b9d-97c3-93d52a7d2936","year":null},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.793553Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:022037667487627ec826ce930b9ddaf7d5c4a0e69925958aba1e7f72175ac5d4","observation_id":"195aeaee-cea7-4511-83eb-78d8fc57b6d6","resolution":{"observed_at":"2026-08-05T15:10:33.989558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:33.960893Z","title":null,"venue":null,"work_id":"e5e17923-8c13-4390-9ada-d40dff0c7d7d","year":null},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.799020Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:bf170a08f35564f50eabdf7d483d9e607295b7a3c1f177fdd7c14d2fb4e0fdbe","observation_id":"644d4000-bae1-4221-b0ee-a9bc24436196","resolution":{"observed_at":"2026-08-05T15:10:33.967077Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:33.939820Z","title":null,"venue":null,"work_id":"71a73a43-ddcb-40eb-b0e9-f3e3d55c7f98","year":null},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.804486Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:7ce21da73e4756388168919aa238af394734b6e3accd990f973276360de67538","observation_id":"6efecd99-9187-48f0-b933-6f8b95435b28","resolution":{"observed_at":"2026-08-05T15:10:33.945415Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:33.911748Z","title":null,"venue":null,"work_id":"b7046809-a025-4ca8-9b99-75a9f5d84772","year":null},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.809625Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:49c2eddd3ee1005df55d08aa5660c641e1b6c840036ac24f54aad4eaf1692152","observation_id":"1178d659-fa6c-4fad-9be6-b90c058b8786","resolution":{"observed_at":"2026-08-05T15:10:33.922676Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:33.887126Z","title":null,"venue":null,"work_id":"5f4bb80b-8eda-4a75-90aa-0866732c2d29","year":null},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.814724Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:a19ffa180340815b29c3b40ea916b66d549ae0dacce4604dfbd06598fc242259","observation_id":"23352d2a-0dcb-4455-9a67-dd15728e7418","resolution":{"observed_at":"2026-08-05T15:10:33.893169Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:33.865553Z","title":"task_fulfillment_reasoning","venue":null,"work_id":"0a1e600d-84e4-4dc9-a816-fca903108880","year":2021},"citing_paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:33.820587Z"},"links":{"citing_paper":"/paper/2508.20453"},"observation_digest":"sha256:aad8dbc310126c7ca2ad681c5b99908d288cdb4bf41c752be57edb81b9ef324b","observation_id":"3b7dc23e-ba46-4d77-b98d-9351064a0318","resolution":{"observed_at":"2026-08-05T15:10:33.872765Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.20453","last_updated":"2025-08-28T05:58:57Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T13:26:56.641456Z","submitted_at":"2025-08-28T05:58:57Z","title":"MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 42 inbound Pith citation observations for arXiv:2508.20453."}