{"as_of":"2026-08-17T20:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:be747bf0d3e6c6a8fdf20d28bc1e53c563c680fe8cd547ebda21b5d48c7a8314","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-08T16:11:49.725631Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.06118/citation-record","integrity":"/paper/2607.06118/integrity","json":"/paper/2607.06118/citation-record.json","paper":"/paper/2607.06118"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.13032","last_updated":"2024-07-17T21:44:28Z","snapshot_observed_at":"2026-08-16T13:33:16.404430Z","submitted_at":"2024-07-17T21:44:28Z","title":"Agent-E: From Autonomous Web Navigation to Foundational Design Principles in Agentic Systems","version":1},"cited_work":{"arxiv_id":"2407.13032","doi":"10.48550/arxiv.2407.13032","metadata_source":"pith","pith_arxiv_id":"2407.13032","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agent-e: From autonomous web navigation to foundational design principles in agentic systems","venue":"cs.AI","work_id":"0405533c-9300-42d1-89d0-d7d509ce813c","year":2024},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"cited_paper":"/paper/2407.13032","citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:17f0ad683c690727568404b428950d4f4dad424f899aa27665948a9a8e318ef0","observation_id":"06787661-ff35-492f-80f1-7df22e8c88fa","resolution":{"observed_at":"2026-07-08T16:15:06.173245Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.916226Z","title":"Official Product Announcement (2025), https://www.anthropic.com/news/claude-sonnet-4-5","venue":null,"work_id":"5cf05b5b-cfce-4d9d-88a9-fa0c13c0da39","year":2025},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:b874f20ff4b4ba6992e5b18da92e75b6a40b42fe1320a74723992d99e14c7e38","observation_id":"03029bd2-3506-45e5-a82a-d1085db6bbc4","resolution":{"observed_at":"2026-07-08T16:15:06.917404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:a41303da8465a1838ba8b1e98b6b110e752febb55b07bd4a597cdb0efd3fb7cf","observation_id":"e2bfcd8a-8a34-4fd2-a13a-84538db6e30c","resolution":{"observed_at":"2026-07-08T16:15:06.142033Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.914459Z","title":"Advances in Neural Information Processing Systems36, 78142–78167 (2023)","venue":null,"work_id":"943936af-c414-4b8d-b7e8-83fcd34e31ec","year":2023},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:5a7cdb33ed3279ef0a40fe983464c621553a15c0691953ee11351c2b15d912d6","observation_id":"81e72636-117a-4819-abc0-cdc2aa7a0ff2","resolution":{"observed_at":"2026-07-08T16:15:06.915716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.917937Z","title":"Advances in Neural Information Processing Systems37, 5996–6051 (2024)","venue":null,"work_id":"3217f438-da56-4923-ad46-ecfc1f9152b8","year":2024},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:7d261fd8888c81d9ceaab2de733b01cb44ce9c8bea9f68665138e89518e241b9","observation_id":"6c694b16-c7fb-4195-8cfc-72e337039286","resolution":{"observed_at":"2026-07-08T16:15:06.919095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.919673Z","title":"In: Proceedings of the AAAI Conference on Artificial Intelligence","venue":null,"work_id":"c2c5aae1-c271-4084-a615-34e351f081c2","year":2024},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:59ee9e557591cb0059c2e5b1f897e12fa763af89becf8609748e90418a85b7aa","observation_id":"d741c6f2-e174-4bd6-80bc-d446962e2e5a","resolution":{"observed_at":"2026-07-08T16:15:06.920815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09911","last_updated":"2024-06-16T15:24:12Z","snapshot_observed_at":"2026-08-16T14:00:46.195792Z","submitted_at":"2024-04-15T16:35:41Z","title":"ChatShop: Interactive Information Seeking with Language Agents","version":2},"cited_work":{"arxiv_id":"2404.09911","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.09911","snapshot_observed_at":"2026-07-08T16:15:06.164869Z","title":"Chatshop: Interactive information seeking with language agents.arXiv preprint arXiv:2404.09911","venue":"cs.CL","work_id":"7242b326-9fbd-4136-acac-cce47ebc1264","year":2024},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"cited_paper":"/paper/2404.09911","citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:d19d39ecdaabe7f65b252ee66092afa2008ea2304cfa0d8b03262f94b30f40a6","observation_id":"acd6c39e-27c5-4cbd-a9f1-c7ebdf899815","resolution":{"observed_at":"2026-07-08T16:15:06.167723Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:d9eaa41b2ff1b014b946592a76f8d8ebd62e29e9feae344e8ed5f49f0a8f6dd8","observation_id":"b97de35a-31ec-42ef-82b8-00e54a4e5271","resolution":{"observed_at":"2026-07-08T16:15:06.191481Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.950336Z","title":"Advances in Neural Information Processing Systems36, 28091–28114 (2023)","venue":null,"work_id":"5c043dcc-9e01-4877-8edf-0f12cea436ca","year":2023},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:cc6bca038f2707856909c9e84f07624088479834e524d37670275a771eaa4efa","observation_id":"f83d7c26-54af-453b-9335-665cc9a33324","resolution":{"observed_at":"2026-07-08T16:15:06.951561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.909370Z","title":"In: Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","venue":null,"work_id":"b89381d6-6b2f-4eaf-b67b-607b52a11fd9","year":2024},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:61c65e1b5bfc449bce3c263a322e75a8df03c16d7d4faa7b9e4b72b4acd55149","observation_id":"a7c9e5f4-7a98-470e-be9d-f41799d08407","resolution":{"observed_at":"2026-07-08T16:15:06.910544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07718","last_updated":"2024-07-23T06:19:28Z","snapshot_observed_at":"2026-08-02T12:09:24.340284Z","submitted_at":"2024-03-12T14:58:45Z","title":"WorkArena: How Capable Are Web Agents at Solving Common Knowledge Work Tasks?","version":5},"cited_work":{"arxiv_id":"2403.07718","doi":"10.48550/arxiv.2403.07718","metadata_source":"pith","pith_arxiv_id":"2403.07718","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WorkArena: How Capable Are Web Agents at Solving Common Knowledge Work Tasks?","venue":"cs.LG","work_id":"5ac27d9e-4522-46f8-985e-0e4f73130803","year":2024},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"cited_paper":"/paper/2403.07718","citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:2e898bfc17b3902cea89b40c79e55a7d79980ab92f317a53c89f7607d8ac4ff2","observation_id":"b969623a-d1b6-4606-a722-9fbd93d51e5c","resolution":{"observed_at":"2026-07-08T16:15:06.163619Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.911099Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":"70d662bc-3bb9-4fbd-b31d-cb61f3578ba0","year":2024},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:300d457cf2cdf79750ea5f4bc80113e7270c503a9db9013e7d8187d0ba99a2c2","observation_id":"ea6a8cf4-8e1d-4d4c-9e47-442a199a34f7","resolution":{"observed_at":"2026-07-08T16:15:06.912202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07286","last_updated":"2023-08-14T17:17:21Z","snapshot_observed_at":"2026-08-17T18:42:06.524312Z","submitted_at":"2023-08-14T17:17:21Z","title":"The Devil is in the Errors: Leveraging Large Language Models for Fine-grained Machine Translation Evaluation","version":1},"cited_work":{"arxiv_id":"2308.07286","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.07286","snapshot_observed_at":"2026-07-08T16:15:06.174509Z","title":"The Devil is in the Errors: Leveraging Large Language Models for Fine-grained Machine Translation Evaluation","venue":"cs.CL","work_id":"4a6f3c0a-6840-4962-96c8-860ca39ce237","year":2023},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"cited_paper":"/paper/2308.07286","citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:1d4db57751df54d2cbab64b65056a18891b4c83b7cace75089897b217ee746aa","observation_id":"7ce5f196-44fe-4ecf-8b36-9062be85e6db","resolution":{"observed_at":"2026-07-08T16:15:06.175905Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.17336","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.150671Z","title":"Mano technical report","venue":null,"work_id":"1178f468-eff6-48b7-8907-d01680d8bc02","year":2025},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:1c8841c2a369085b061e26f8d08b95165345761990411a62dbb63ab0724124b9","observation_id":"b2db4765-23b1-4a68-9599-1ea8aec701e4","resolution":{"observed_at":"2026-07-08T16:15:06.152082Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.907613Z","title":"In: NeurIPS 2023 Foundation Models for Decision Making Workshop (2023)","venue":null,"work_id":"825bf669-2673-449c-8e98-c0f14d857f8e","year":2023},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:e7d14ee58f5c9540111e59047a5ed9ea7327345ea1b2e01e9cda9636fea2ce1c","observation_id":"667e2d04-628f-458e-9eed-4398d0ce090c","resolution":{"observed_at":"2026-07-08T16:15:06.908800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11543","last_updated":"2025-04-17T16:28:46Z","snapshot_observed_at":"2026-08-16T12:40:45.015038Z","submitted_at":"2025-04-15T18:22:55Z","title":"REAL: Benchmarking Autonomous Agents on Deterministic Simulations of Real Websites","version":2},"cited_work":{"arxiv_id":"2504.11543","doi":"10.48550/arxiv.2504.11543","metadata_source":"pith","pith_arxiv_id":"2504.11543","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"REAL: Benchmarking Autonomous Agents on Deterministic Simulations of Real Websites.arXiv preprint arXiv:2504.11543, April 2025","venue":"cs.AI","work_id":"300f41f0-3fbd-4eb3-932a-79bd75163d47","year":2025},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"cited_paper":"/paper/2504.11543","citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:7b82b59b62d751f42735ba5104e1912002ea6f71dfc31ed21e21a596b76e355b","observation_id":"6dc4e38a-c8f0-4bd9-a5f7-1d1a654824fe","resolution":{"observed_at":"2026-07-08T16:15:06.149393Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-05-20T18:52:15.678539+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T18:52:15.678539+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:01ea03203ee10a5641ce5309c747efb9831e3934144d661ba8b7627720b8a94a","observation_id":"6c815a94-bf2d-4715-85f8-5ee9de747242","resolution":{"observed_at":"2026-07-08T16:15:06.199956Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13919","last_updated":"2024-06-06T18:37:34Z","snapshot_observed_at":"2026-08-15T01:23:25.524198Z","submitted_at":"2024-01-25T03:33:18Z","title":"WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models","version":4},"cited_work":{"arxiv_id":"2401.13919","doi":"10.48550/arxiv.2401.13919","metadata_source":"pith","pith_arxiv_id":"2401.13919","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models","venue":"cs.CL","work_id":"12c1d840-af20-4a4e-8750-6b9c6266638f","year":2024},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"cited_paper":"/paper/2401.13919","citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:5bb84320beed4be7d4d10c33fb7fd36a3e9942f659cd9b09b1f46038d70dcf6f","observation_id":"45f44b0b-c39f-4463-88ca-a83e56f48f70","resolution":{"observed_at":"2026-07-08T16:15:06.178735Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.905764Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"8b58ba2d-5212-4b12-ae47-3b4fdb2f3bc1","year":2024},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:149c6ed577440e5e04f25c3e7865454fa94fc5090ef4ee94174525ca60e02e4e","observation_id":"afbee48b-a87f-4657-91e7-41ea4ef6db7d","resolution":{"observed_at":"2026-07-08T16:15:06.906911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:648620d539e72bf832fd07946f51712c468130bb3b31b110c5362614c2c787c7","observation_id":"8fa6923c-366e-448c-8a72-23f1bf12a43c","resolution":{"observed_at":"2026-07-08T16:15:06.181170Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.902403Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":"43b89e87-8b04-48f7-822a-4df5825d2af9","year":2024},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:3b54d34c05e507ce8e4404a0dd93c4be92d21dce9a9d6b4e4bbabe8d06bcdff7","observation_id":"d3bc22cb-88cd-41e1-9e57-34ab7b0d3b40","resolution":{"observed_at":"2026-07-08T16:15:06.903479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.900741Z","title":"In: ICLR 2025 Workshop on Foundation Models in the Wild (2025)","venue":null,"work_id":"df66c81f-ac33-4f69-8d77-ad923da5334c","year":2025},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:dfe44dbec2d349a6b665439d6058fbdf3c160677942714e79e430ed9541d1089","observation_id":"bc0802a3-232e-4968-891b-747ded284f0a","resolution":{"observed_at":"2026-07-08T16:15:06.901836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13649","last_updated":"2024-06-06T02:01:09Z","snapshot_observed_at":"2026-08-15T00:56:43.641640Z","submitted_at":"2024-01-24T18:35:21Z","title":"VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks","version":2},"cited_work":{"arxiv_id":"2401.13649","doi":"10.48550/arxiv.2401.13649","metadata_source":"pith","pith_arxiv_id":"2401.13649","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks","venue":"cs.LG","work_id":"37f08c56-1b7d-4d9e-baf9-7c2ebb7e6acd","year":2024},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"cited_paper":"/paper/2401.13649","citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:f2295ad98c4a9d528a1c3bccb72df761c903db27fc874c53503fa5fd31f62698","observation_id":"218ca6f1-97d4-4419-9fba-32b69fd714ca","resolution":{"observed_at":"2026-07-08T16:15:06.139548Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-15T07:08:14.13759+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T07:08:14.13759+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.897606Z","title":"In: Proceedings of the 30th ACM SIGKDD Conference on Knowledge Discovery and Data Mining","venue":null,"work_id":"09ae8396-fc7a-4da6-ad8f-4bcffc4900cf","year":2024},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:2150e410bdb4ef657373976a22d31495e82e9479d6afcb9b87233bc3de3f729a","observation_id":"d6e16495-0b25-44fb-9f5e-424020b0dbd2","resolution":{"observed_at":"2026-07-08T16:15:06.898757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06703","last_updated":"2026-06-04T09:59:28Z","snapshot_observed_at":"2026-08-16T13:11:11.539278Z","submitted_at":"2024-10-09T09:13:38Z","title":"ST-WebAgentBench: A Benchmark for Evaluating Safety and Trustworthiness in Web Agents","version":7},"cited_work":{"arxiv_id":"2410.06703","doi":"10.48550/arxiv.2410.06703","metadata_source":"pith","pith_arxiv_id":"2410.06703","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"St- webagentbench: A benchmark for evaluating safety and trustworthiness in web agents","venue":"cs.AI","work_id":"02dc69db-8db6-48b1-ac24-4004642dfa94","year":2024},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"cited_paper":"/paper/2410.06703","citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:3f773b4d58955a634e8be210c4308ea358ec7bbd5d211be839f5ef3a50674213","observation_id":"94304a56-1081-4421-8e21-e07f0d33824b","resolution":{"observed_at":"2026-07-08T16:15:06.158251Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.895918Z","title":null,"venue":null,"work_id":"7139dc8a-27a0-4c48-b6a3-51a6fcadafbb","year":2023},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:fde181a5cc636765594b5d7d463c9e7d72c421674873dc6023136a803558635b","observation_id":"663d5d8c-ad67-4e79-8c0b-17d002ee5598","resolution":{"observed_at":"2026-07-08T16:15:06.897003Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.08802","last_updated":"2018-02-24T05:32:47Z","snapshot_observed_at":"2026-08-14T19:42:39.161822Z","submitted_at":"2018-02-24T05:32:47Z","title":"Reinforcement Learning on Web Interfaces Using Workflow-Guided Exploration","version":1},"cited_work":{"arxiv_id":"1802.08802","doi":"10.48550/arxiv.1802.08802","metadata_source":"pith","pith_arxiv_id":"1802.08802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning on Web Interfaces Using Workflow-Guided Exploration","venue":"cs.AI","work_id":"a790be26-7c4c-4e58-ab4a-906e2570cc69","year":2018},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"cited_paper":"/paper/1802.08802","citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:fb710bc9bb88f150f7757b29b0dce36d0192dc5d6785d44c333086d030adb190","observation_id":"21336d68-4879-4e8c-a23b-0f4a87e51b00","resolution":{"observed_at":"2026-07-08T16:15:06.183705Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05955","last_updated":"2024-04-09T02:29:39Z","snapshot_observed_at":"2026-08-17T00:01:45.419694Z","submitted_at":"2024-04-09T02:29:39Z","title":"VisualWebBench: How Far Have Multimodal LLMs Evolved in Web Page Understanding and Grounding?","version":1},"cited_work":{"arxiv_id":"2404.05955","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.05955","snapshot_observed_at":"2026-07-08T16:15:06.153368Z","title":"arXiv preprint arXiv:2404.05955 , year=","venue":"cs.CL","work_id":"b65ed183-95d3-4265-a05b-55aa2ec45c7a","year":2024},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"cited_paper":"/paper/2404.05955","citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:a4e1f249f783b734e03974129a8fbaef6f83403cff73cdfebdc94257facb3d56","observation_id":"8e37b665-4417-4cd4-acbf-bbb52ec8eb24","resolution":{"observed_at":"2026-07-08T16:15:06.155483Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03688","last_updated":"2025-10-04T03:54:18Z","snapshot_observed_at":"2026-08-16T00:51:32.846970Z","submitted_at":"2023-08-07T16:08:11Z","title":"AgentBench: Evaluating LLMs as Agents","version":3},"cited_work":{"arxiv_id":"2308.03688","doi":"10.1109/fllm63129.2024.10852426","metadata_source":"pith","pith_arxiv_id":"2308.03688","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AgentBench: Evaluating LLMs as Agents","venue":"cs.AI","work_id":"a37549b4-4c94-412d-acc4-4efeb08509be","year":2023},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"cited_paper":"/paper/2308.03688","citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:bc11d2c21d0f05c8465e4115f3a9b453b9ec239e3d52d8f4d454c6ce1194b21c","observation_id":"0df533bd-d95b-4737-b9f7-946f921a1e05","resolution":{"observed_at":"2026-07-08T16:15:06.137100Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06327","last_updated":"2024-08-12T17:44:17Z","snapshot_observed_at":"2026-08-16T13:26:56.510314Z","submitted_at":"2024-08-12T17:44:17Z","title":"VisualAgentBench: Towards Large Multimodal Models as Visual Foundation Agents","version":1},"cited_work":{"arxiv_id":"2408.06327","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.06327","snapshot_observed_at":"2026-07-08T16:15:06.195854Z","title":"Visualagentbench: Towards large multimodal models as visual foundation agents","venue":"cs.AI","work_id":"f8c24c07-39ea-4c7b-9a23-b7cc2ad238df","year":2024},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"cited_paper":"/paper/2408.06327","citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:8eb6536bf83ba0dad265ff7d98c3bbcf1df578cb3dced4a51ed419cc035e14d8","observation_id":"cf9507c0-f886-4110-9269-0b6b154c13d8","resolution":{"observed_at":"2026-07-08T16:15:06.197306Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.899291Z","title":null,"venue":null,"work_id":"1ae89782-abbc-4125-bc48-ec564046d64b","year":2024},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:64e8f21cf1d38fc8b25a11475c0e4f470056cf725a9c2c650da1f2866b4ba504","observation_id":"60cad104-1700-4f90-8350-af856bf446ed","resolution":{"observed_at":"2026-07-08T16:15:06.900247Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.904013Z","title":"Official Product An- nouncement (2025),https://openai.com/index/introducing-o3-and-o4-mini/","venue":null,"work_id":"a07f8ce0-ffe3-43fe-819b-a87166d2a4a3","year":2025},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:80ae82ad46cf36b0702a376763ffb3df425d11b8fff9365d32ff48394b2c0834","observation_id":"4187d94f-fe8e-4a58-9650-083fca57cdd2","resolution":{"observed_at":"2026-07-08T16:15:06.905175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06474","last_updated":"2024-10-07T14:19:37Z","snapshot_observed_at":"2026-08-16T14:02:19.249974Z","submitted_at":"2024-04-09T17:25:47Z","title":"Autonomous Evaluation and Refinement of Digital Agents","version":3},"cited_work":{"arxiv_id":"2404.06474","doi":"10.48550/arxiv.2404.06474","metadata_source":"pith","pith_arxiv_id":"2404.06474","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Autonomous evaluation and refinement of digital agents","venue":"cs.AI","work_id":"dbebca6b-661a-477f-8531-779b4221ac8b","year":2024},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"cited_paper":"/paper/2404.06474","citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:daebf3f7cd5ee3405a72bbcf11fab1639273dece744cb360c468ddd3f785cf4e","observation_id":"95811a26-e939-4d91-85a2-3406407db7f3","resolution":{"observed_at":"2026-07-08T16:15:06.186003Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12373","last_updated":"2024-07-16T06:19:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-18T07:58:33Z","title":"WebCanvas: Benchmarking Web Agents in Online Environments","version":3},"cited_work":{"arxiv_id":"2406.12373","doi":"10.48550/arxiv.2406.12373","metadata_source":"pith","pith_arxiv_id":"2406.12373","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebCanvas: Benchmarking Web Agents in Online Environments","venue":"cs.CL","work_id":"b8949e88-00ed-4d70-b935-0761ce59b669","year":2024},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"cited_paper":"/paper/2406.12373","citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:123a816a95411dd78e8f8467ca887a5371c502abad0b5c8806d700793af54ceb","observation_id":"58662504-66b9-4f0e-a865-87b08c2261b5","resolution":{"observed_at":"2026-07-08T16:15:06.188595Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-08-16T21:34:35.147772Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":"2501.12326","doi":"10.48550/arxiv.2501.12326","metadata_source":"pith","pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","venue":"cs.AI","work_id":"0bbcf263-a46d-4525-a438-11fce3316568","year":2025},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:3e5f32c097123458023dc47f8a6d3beecf704f27b9fc0da2cd9e5887378b909a","observation_id":"db0d6835-8efb-4445-b0c2-56b1ca0abb44","resolution":{"observed_at":"2026-07-08T16:15:06.170568Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:19.638951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:19.638951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.886744Z","title":"In: International Conference on Machine Learning","venue":null,"work_id":"88522992-a03a-425e-a991-417a60a80850","year":2017},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:c1e25a7cb640370ca343ab26ae0e0294bdc8f2eea0fe94cfb4a954d542dd493f","observation_id":"3bfc5e02-81cd-4efc-bc02-3ebd6594fbd3","resolution":{"observed_at":"2026-07-08T16:15:06.888355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07919","last_updated":"2025-07-24T17:45:05Z","snapshot_observed_at":"2026-08-16T14:24:31.715986Z","submitted_at":"2025-03-10T23:50:30Z","title":"BEARCUBS: A benchmark for computer-using web agents","version":3},"cited_work":{"arxiv_id":"2503.07919","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.07919","snapshot_observed_at":"2026-07-08T16:15:06.192914Z","title":"Bearcubs: A benchmark for computer-using web agents","venue":"cs.AI","work_id":"cea96bfb-b39d-4c27-9c28-d03836ce5aeb","year":2025},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"cited_paper":"/paper/2503.07919","citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:5eed3bf69f9221ae495ea9991c33a84afabdb4fd174e20fd8e6ccf20885088fc","observation_id":"d125ef64-429e-4da5-bc64-b6189d4cf838","resolution":{"observed_at":"2026-07-08T16:15:06.194530Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.889050Z","title":"In: Findings of the Association for Computational Linguis- tics: ACL 2025","venue":null,"work_id":"f952abf7-4c09-4288-8e4b-a232a5bba6d4","year":2025},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:ed8e34186d7301334a711a639c42266ce048f19fe7b5da719e4ef0894d0ea739","observation_id":"782a0652-941a-42a7-94c1-a4bff4b9b72e","resolution":{"observed_at":"2026-07-08T16:15:06.890235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.890807Z","title":"Advances in Neural Information Processing Systems37, 115963–116021 (2024)","venue":null,"work_id":"aeef0d8a-1fbf-4152-b7cf-9b6fb802a3c6","year":2024},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:fec419d708a9b2e69c1c4e35982efd9ef0e085151f9f4e011971fa59e5314f53","observation_id":"1e54e159-d65a-4440-9237-ee6b61101bf2","resolution":{"observed_at":"2026-07-08T16:15:06.891960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09605","last_updated":"2025-03-03T18:59:36Z","snapshot_observed_at":"2026-08-13T12:40:26.071591Z","submitted_at":"2024-12-12T18:59:27Z","title":"AgentTrek: Agent Trajectory Synthesis via Guiding Replay with Web Tutorials","version":2},"cited_work":{"arxiv_id":"2412.09605","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09605","snapshot_observed_at":"2026-07-08T16:15:06.159458Z","title":"arXiv preprint arXiv:2412.09605 , year=","venue":"cs.CL","work_id":"6b2be3e7-9638-4dd7-abab-0074d201d8b0","year":2024},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"cited_paper":"/paper/2412.09605","citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:f4ee4e10e9910e38c6ad68f8b7cbbbff154ff78c38516f992d776f8154437ba4","observation_id":"fa945c79-1228-4942-babe-d85312edaf71","resolution":{"observed_at":"2026-07-08T16:15:06.161036Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.892537Z","title":"In: Second Conference on Language Modeling (2025),https://openreview.net/forum?id=6jZi4HSs6o","venue":null,"work_id":"1ea8359c-4053-4bcd-b1ec-fbd4d2a2de69","year":2025},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:f2ca2265772d808878a3c5a92089e45b5f03e18ed9438095c839a8064ba6327b","observation_id":"1af37a66-1fd2-4ab9-9037-b4127c28a134","resolution":{"observed_at":"2026-07-08T16:15:06.893683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.894183Z","title":"In: ArXiv (preprint)","venue":null,"work_id":"a53a8e33-db70-461e-87d2-5b73a87d5ce7","year":null},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:1ac2af45a4d18b9425cfa4e181bffde5155838544f857e82a5e453473d49cfd0","observation_id":"e11ff1da-4135-49d2-b472-6fd3c58faa93","resolution":{"observed_at":"2026-07-08T16:15:06.895362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15711","last_updated":"2024-10-21T15:45:31Z","snapshot_observed_at":"2026-08-16T13:32:06.421640Z","submitted_at":"2024-07-22T15:18:45Z","title":"AssistantBench: Can Web Agents Solve Realistic and Time-Consuming Tasks?","version":2},"cited_work":{"arxiv_id":"2407.15711","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.15711","snapshot_observed_at":"2026-07-08T16:15:06.145782Z","title":"2407.15711 , archivePrefix=","venue":"cs.CL","work_id":"e104d3d8-30eb-452f-8dcf-7b49d40f651c","year":2024},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"cited_paper":"/paper/2407.15711","citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:ebfb0e0645e521d7774923c964f96f0c365196a0b712c90be66e7a3df804ba2b","observation_id":"622653ac-1134-467a-a48a-ad690fafde7a","resolution":{"observed_at":"2026-07-08T16:15:06.146949Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01614","last_updated":"2024-03-12T23:14:33Z","snapshot_observed_at":"2026-08-13T20:16:41.272728Z","submitted_at":"2024-01-03T08:33:09Z","title":"GPT-4V(ision) is a Generalist Web Agent, if Grounded","version":2},"cited_work":{"arxiv_id":"2401.01614","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.01614","snapshot_observed_at":"2026-07-08T16:15:06.143411Z","title":"GPT-4V(ision) is a Generalist Web Agent, if Grounded","venue":"cs.IR","work_id":"d3503fef-7f64-4dcc-8aca-1f16e997034f","year":2024},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"cited_paper":"/paper/2401.01614","citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:f057a17e2e0ab10e1c183344def4f4f7c38e265d90de4e0d65f3713c8a0cf607","observation_id":"ffeec677-9f78-4e36-84b2-2fc5813ac791","resolution":{"observed_at":"2026-07-08T16:15:06.144645Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.912759Z","title":"Advances in neural information processing systems36, 46595–46623 (2023)","venue":null,"work_id":"4e26dd35-f533-4a88-8ff3-e09a723d4cd9","year":2023},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:293048b16c2ef112879cdced8d4dbd045ad65b7c506e0bd30263bcdae75d0178","observation_id":"3e0f2e3a-b877-4246-940a-94a767323bdb","resolution":{"observed_at":"2026-07-08T16:15:06.913921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.944737Z","title":"ICLR (2024)","venue":null,"work_id":"f06eb206-766a-4431-b4f5-dbf319d05c57","year":2024},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:f665e882f666bde7aa00f56b9353879a4c16cb977d4e8e3485882b715f3c9161","observation_id":"8c649a3e-3a86-434e-9684-06070b64d526","resolution":{"observed_at":"2026-07-08T16:15:06.945888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.946531Z","title":"Support” l Click “Predicting with your Models","venue":null,"work_id":"17068656-1820-4025-918b-6257489d5aa3","year":2024},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:af814caee509541f6fd5daa087c5028e14cb54a59d3580e9cead6c7a6ff485bd","observation_id":"5981e5f8-5be1-4743-a4d1-1f1d460925b4","resolution":{"observed_at":"2026-07-08T16:15:06.947714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.942966Z","title":"Every requirement, keyword, constraint, or objective in the task is treated as a criterion","venue":null,"work_id":"1f8ae7c0-dbec-437b-90a1-e82aa4be9dd1","year":null},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:6470f78a27f10a41c1199e4f9cbe759143d30209ae653d411380d9a369f4a2e9","observation_id":"18f31368-c06c-48e3-8a3f-610ae5a182c6","resolution":{"observed_at":"2026-07-08T16:15:06.944193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.936580Z","title":null,"venue":null,"work_id":"9d46bc34-7024-4417-b2c6-f10d679e6dfe","year":null},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:118d74e563b62d9f91f0a2bfd4df0d9702cc04b03d1c80ea302522df43d8597a","observation_id":"865eb141-290c-44c8-9137-d93f14e7b531","resolution":{"observed_at":"2026-07-08T16:15:06.937622Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.938168Z","title":null,"venue":null,"work_id":"c98f1701-e570-4fac-b050-5542eb58c27a","year":null},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:b2a40e3287af4fdcbcd6ba2d8d58e3abb387ece87335c15d428bdb17e0d2522e","observation_id":"b9a1771d-a6f9-46c4-b1ac-ddfbcc34adbb","resolution":{"observed_at":"2026-07-08T16:15:06.939160Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.941226Z","title":"submit”, “search","venue":null,"work_id":"6a5b503e-26b0-4f95-a223-c76b95cb334c","year":null},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:bda651657be3edff63b252f256fed220b40c795e7ebc672680545f1a15702cea","observation_id":"aa1eab71-1776-4e32-99f3-f3769a6f05e8","resolution":{"observed_at":"2026-07-08T16:15:06.942401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.939636Z","title":"No quotes, no bullets, no numbering","venue":null,"work_id":"3a9f319a-c81d-4982-a170-dd2dfdc593e0","year":null},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:0acb66f1380149e97e4231d0bdb3dfa878bb60f1541d69b5d5208c3049490285","observation_id":"083a542b-cd0a-4961-9f6d-97715acd8557","resolution":{"observed_at":"2026-07-08T16:15:06.940670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.948420Z","title":"Do NOT mechanically list actions; instead, describe actions as steps that move toward completing the goal","venue":null,"work_id":"bdb146a6-dadd-4c30-af2a-ed1e1dcf4e65","year":null},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:ab40c9852b572633289a3a901bb4798732ba86cc1c7ae29efb1c7e69007ab75b","observation_id":"09d6f12a-2fef-4671-9399-547ec14337d3","resolution":{"observed_at":"2026-07-08T16:15:06.949657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.952094Z","title":null,"venue":null,"work_id":"20e5f521-ab7e-4349-862a-62deaadfc607","year":null},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:0e6161bd94c81dafb077ff74933e2b187da9f985eb351cef42ad0b235976926b","observation_id":"6c8f433f-f831-4047-a4a3-d7ae0f4b4183","resolution":{"observed_at":"2026-07-08T16:15:06.953115Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.931356Z","title":null,"venue":null,"work_id":"19a20049-d6a6-4128-9d6b-28a0685c1adc","year":null},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:883788fbe9bfc433c62207d23f4bb2e98ed9965486d7aeea48f631210baa4703","observation_id":"11bd375c-0bdd-479c-a0ae-20b849e8d731","resolution":{"observed_at":"2026-07-08T16:15:06.932390Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.934891Z","title":"** Click/selection wording constraints:","venue":null,"work_id":"1ee82f84-8133-4829-8e3d-e78f4af63bab","year":null},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:e293004d940aaf32d6c8152a80524a937e12e115d85ab16ad1893296ac06c6f2","observation_id":"cb65d2f7-e168-45f6-87b9-e157a6ceaf5e","resolution":{"observed_at":"2026-07-08T16:15:06.936056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.928272Z","title":null,"venue":null,"work_id":"bc4bc47a-4172-4a62-880c-61e0e5fa3460","year":null},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:0ee80d6ab99e4c842df8b8c917659b0c7d7f3c0a0bfdd0ceb0c8f8a2d05253e2","observation_id":"ab9283f2-dff7-4d71-bb78-5df406407828","resolution":{"observed_at":"2026-07-08T16:15:06.929298Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.923064Z","title":"If a label is necessary, keep it short and functional","venue":null,"work_id":"5ce790c4-3b76-4887-8115-78e4f9fd4bef","year":null},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:7fb9ec1140e2e214d9065106934ee80929f4d567cc1970c6fc98109aa2a880c0","observation_id":"1abdfeaf-e13b-4350-bdc2-ef94be832507","resolution":{"observed_at":"2026-07-08T16:15:06.924230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.921501Z","title":"** Output constraints:","venue":null,"work_id":"11d8421e-ebf2-46ff-9411-582b232a9294","year":null},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:174585b19231345aa332366d1a94053c4815db108d35e00e7b2b154dfb29295e","observation_id":"b8f8701e-c889-4ac7-b526-5fa9350cb287","resolution":{"observed_at":"2026-07-08T16:15:06.922535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.924801Z","title":null,"venue":null,"work_id":"af133dbc-bd74-4229-ae7a-a0147685175f","year":null},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:efedfacf2b4dd19af139ee23665884683fb44d006188ad5fafdd24bbcb90d923","observation_id":"1c3e32ad-29bd-4f37-bf94-8f60671af91a","resolution":{"observed_at":"2026-07-08T16:15:06.925836Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.926320Z","title":"first... then... next... during... finally","venue":null,"work_id":"a904aa31-7908-4c83-9ad6-dd48ca144553","year":null},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:df1be61cfbcc49d1f26339067860401634a11ef55ce8eda03a190634221dc48b","observation_id":"e97886db-926a-49e4-8c38-8a96b4eccb5b","resolution":{"observed_at":"2026-07-08T16:15:06.927739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.929807Z","title":null,"venue":null,"work_id":"4d129ab7-24df-41fc-9006-c144f4ec9ab9","year":null},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:42f8e8936c11039582e000043e5052cae2d7bb56dddd02a668b75b6bdc8e87a7","observation_id":"204ad6d6-e95a-4e3d-ac4a-e059da368e67","resolution":{"observed_at":"2026-07-08T16:15:06.930806Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.933052Z","title":"User Prompt: Task: <task> Website: <website> Trajectory: <trajectory> Now generate the operational document sentence:","venue":null,"work_id":"51fa4fad-3ea0-4666-8e2b-411a4513cef7","year":null},"citing_paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-08T16:11:49.725631Z"},"links":{"citing_paper":"/paper/2607.06118"},"observation_digest":"sha256:86bffa97eefa90fee7ca64c1a7481968d41a98524c04304b165de6f9600fb203","observation_id":"f5f3d101-7966-47b9-b9c4-e1475a5d480b","resolution":{"observed_at":"2026-07-08T16:15:06.934323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.06118","last_updated":"2026-07-07T10:27:31Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T12:30:22.342026Z","submitted_at":"2026-07-07T10:27:31Z","title":"WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":16,"parse_uncertain":0,"unresolved":9,"verified_exact":8,"verified_fuzzy":30},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 0 inbound Pith citation observations for arXiv:2607.06118."}