{"as_of":"2026-08-07T21:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3509abe5d4c149948ae87004732ff49e78417290ce08b939de194753a0b7e6be","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:16:27.016316Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T14:45:56.506288Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T22:56:19.580749Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"cited_work":{"arxiv_id":"2505.24878","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24878","snapshot_observed_at":"2026-07-01T22:56:19.580749Z","title":"Open captchaworld: A comprehensive web-based platform for testing and benchmarking multimodal llm agents","venue":null,"work_id":"31a07845-51b5-4211-82d6-43018f1a2ec2","year":2025},"citing_paper":{"arxiv_id":"2510.23883","last_updated":"2026-04-03T16:27:34Z","snapshot_observed_at":"2026-08-02T13:42:34.526072Z","submitted_at":"2025-10-27T21:48:11Z","title":"Agentic AI Security: Threats, Defenses, Evaluation, and Open Challenges","version":3},"reference_index":167,"source":"pdf_text","source_observed_at":"2026-05-18T03:42:10.703369Z"},"links":{"cited_paper":"/paper/2505.24878","citing_paper":"/paper/2510.23883"},"observation_digest":"sha256:844cf3a46b571c5ef0e75e1f1eb8cad1d9b6329520583d2f71a039dda6f9c04b","observation_id":"dc9c335b-065f-405c-a134-7afa15c65c37","resolution":{"observed_at":"2026-05-18T03:42:22.039877Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"cited_work":{"arxiv_id":"2505.24878","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24878","snapshot_observed_at":"2026-07-01T22:56:19.580749Z","title":"Open captchaworld: A comprehensive web-based platform for testing and benchmarking multimodal llm agents","venue":null,"work_id":"31a07845-51b5-4211-82d6-43018f1a2ec2","year":2025},"citing_paper":{"arxiv_id":"2512.02318","last_updated":"2026-05-12T02:06:16Z","snapshot_observed_at":"2026-07-06T22:37:31.360740Z","submitted_at":"2025-12-02T01:23:10Z","title":"COGNITION: From Evaluation to Defense against Multimodal LLM CAPTCHA Solvers","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T03:23:03.198463Z"},"links":{"cited_paper":"/paper/2505.24878","citing_paper":"/paper/2512.02318"},"observation_digest":"sha256:cf8f68c54e0b3376df91f14c93fd0294e01613c249b781c0dabb2d2ddee4d1e7","observation_id":"7f2c9b87-98f2-4dbd-b6e8-d8c6495768d7","resolution":{"observed_at":"2026-05-17T03:23:57.983899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"cited_work":{"arxiv_id":"2505.24878","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24878","snapshot_observed_at":"2026-07-01T22:56:19.580749Z","title":"Open captchaworld: A comprehensive web-based platform for testing and benchmarking multimodal llm agents","venue":null,"work_id":"31a07845-51b5-4211-82d6-43018f1a2ec2","year":2025},"citing_paper":{"arxiv_id":"2606.02449","last_updated":"2026-06-01T16:20:45Z","snapshot_observed_at":"2026-07-06T23:42:49.173711Z","submitted_at":"2026-06-01T16:20:45Z","title":"HLL: Can Agents Cross Humanity's Last Line of Verification?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T14:57:57.218669Z"},"links":{"cited_paper":"/paper/2505.24878","citing_paper":"/paper/2606.02449"},"observation_digest":"sha256:04c16e31565bc91f4b0c2e52f342188bf8a641d7a55f4117d28ae97935f931b7","observation_id":"b2f85212-f096-43df-936e-dca4295716bc","resolution":{"observed_at":"2026-07-01T22:56:19.583281Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24878","snapshot_observed_at":"2026-08-01T14:45:56.506288Z","title":"Open captchaworld: A comprehensive web-based platform for testing and benchmarking multimodal llm agents.arXiv preprint arXiv:2505.24878, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18659","last_updated":"2026-07-21T03:02:57Z","snapshot_observed_at":"2026-08-07T09:13:55.626528Z","submitted_at":"2026-07-21T03:02:57Z","title":"Broken Gates: Re-evaluating Web Bot Defenses in the Age of LLM Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T14:45:56.506288Z"},"links":{"cited_paper":"/paper/2505.24878","citing_paper":"/paper/2607.18659"},"observation_digest":"sha256:e8360c168150a2899970534cf0bbe63a9619f1396765d4a2ebcf430e747a80d3","observation_id":"1e9173ce-1855-42c5-9deb-ca06122ddbce","resolution":{"observed_at":"2026-08-01T14:45:56.506288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24878/citation-record","integrity":"/paper/2505.24878/integrity","json":"/paper/2505.24878/citation-record.json","paper":"/paper/2505.24878"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-07T12:16:22.058110Z","title":"Flamingo: A visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:22.058110Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:0a3f3e65a768e6e75607ed2decb04516a358d3c6e1518346a40fef42e4910348","observation_id":"2d9246e3-756a-499c-88e0-38d0731381b7","resolution":{"observed_at":"2026-08-07T12:16:22.058110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:29.999809Z","title":"Claude 3.7 Sonnet System Card","venue":null,"work_id":"bfa7f9a7-0d20-4686-8ef8-134f8c071093","year":2025},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:22.148677Z"},"links":{"citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:d79d6cc7207b503767e24817b03f37f3c9d68f7b259f05369e3a8df1ec0801bc","observation_id":"f1fde33c-9802-4c66-9479-4a51cca99e45","resolution":{"observed_at":"2026-08-07T12:16:30.038832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T12:16:22.240512Z","title":"Qwen-vl: A versatile vision–language model for perception, localization, and generation.arXiv preprint arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:22.240512Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:e73a3b9d2a71faaf4a4c4a363a732e791bd9b162b4e32a82c6a83a18ccda97ea","observation_id":"8cd90733-1730-4365-a1f1-1da81cf6a2df","resolution":{"observed_at":"2026-08-07T12:16:22.240512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-07T12:16:22.413093Z","title":"Internvl: Scaling up vision foundation models and aligning for generic vision–language understanding.arXiv preprint arXiv:2312.14238, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:22.413093Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:bf0734b2f4d8184fe5081e8cd5d283265c5b83318644ac649789c5661fe4dba9","observation_id":"8f992786-6b47-46f0-b163-09ba2149e385","resolution":{"observed_at":"2026-08-07T12:16:22.413093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11536","last_updated":"2025-04-17T16:46:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T18:10:22Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11536","snapshot_observed_at":"2026-08-07T12:16:22.513582Z","title":"Retool: Reinforcement learning for strategic tool use in llms.arXiv preprint arXiv:2504.11536, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:22.513582Z"},"links":{"cited_paper":"/paper/2504.11536","citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:8c98a148d323112d5b960bc6dcc56a9652893ebaf6c4008e92f2c3e67373d894","observation_id":"a7884ebb-dedb-46c9-b75f-d74ce5e0840c","resolution":{"observed_at":"2026-08-07T12:16:22.513582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:22.644201Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:22.644201Z"},"links":{"citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:d18207c31720c07d25634dfad99b4d903703f6345cfa516d1e493c4af116d579","observation_id":"92da3802-4361-4744-80a0-7b8dd8df97c1","resolution":{"observed_at":"2026-08-07T12:16:22.644201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:29.835427Z","title":"Gemini 2.5 pro: Our most intelligent ai model","venue":null,"work_id":"d68da35c-8087-4346-a37e-1f756483ddcf","year":2025},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:22.722596Z"},"links":{"citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:ed92100cd2917e99dbff4041cc0005cb8e2f5e974169ac55469e6897e6ad55f9","observation_id":"c7f316e4-5392-451e-afc9-0b28dc1118ec","resolution":{"observed_at":"2026-08-07T12:16:29.915407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17452","last_updated":"2024-02-21T12:59:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:38Z","title":"ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17452","snapshot_observed_at":"2026-08-07T12:16:22.878232Z","title":"Tora: A tool-integrated reasoning agent for mathematical problem solving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:22.878232Z"},"links":{"cited_paper":"/paper/2309.17452","citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:78164149774c116fd63e460462980effad507838979b8bad8cdc058cfc556ad1","observation_id":"cb064953-eadb-486c-bd05-5b0e3ab59606","resolution":{"observed_at":"2026-08-07T12:16:22.878232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:29.537732Z","title":"Making the v in VQA matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":"cdb9a255-7d19-452e-be5c-3cbad4bd75e6","year":2017},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:22.979257Z"},"links":{"citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:61611b377f260862b49412882630e48acf3a35dceaf55d1c31b47e6436885406","observation_id":"f17ade13-c1bf-4358-9893-8e99c5fef9a9","resolution":{"observed_at":"2026-08-07T12:16:29.588992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:23.076403Z","title":"Making the V in VQA matter: Elevating the role of image understanding in Visual Question Answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:23.076403Z"},"links":{"citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:e8a216deea3962b8b38b5b10a9e27e2516916f27276ababcb80fb7a85c0c564a","observation_id":"4ac3070e-20df-47bc-9ca2-4d8c227e0e65","resolution":{"observed_at":"2026-08-07T12:16:23.076403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17589","last_updated":"2024-12-23T14:02:12Z","snapshot_observed_at":"2026-07-06T20:12:09.120832Z","submitted_at":"2024-12-23T14:02:12Z","title":"PC Agent: While You Sleep, AI Works -- A Cognitive Journey into Digital World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17589","snapshot_observed_at":"2026-08-07T12:16:23.180088Z","title":"Pc agent: While you sleep, ai works–a cognitive journey into digital world.arXiv preprint arXiv:2412.17589, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:23.180088Z"},"links":{"cited_paper":"/paper/2412.17589","citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:ef01caaac282aded039d9729e3b8b5584f1a685dd9474934c2d24fa780dbf055","observation_id":"5223b282-d58a-4cd3-a7d7-12bb6f221b0f","resolution":{"observed_at":"2026-08-07T12:16:23.180088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.09506","last_updated":"2019-05-10T22:24:55Z","snapshot_observed_at":"2026-08-04T09:51:28.249111Z","submitted_at":"2019-02-25T18:37:49Z","title":"GQA: A New Dataset for Real-World Visual Reasoning and Compositional Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.09506","snapshot_observed_at":"2026-08-07T12:16:23.288396Z","title":"Hudson and Christopher D","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:23.288396Z"},"links":{"cited_paper":"/paper/1902.09506","citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:c17fde8b7ca1ee4b89e6ad2313247a4c8cbe9e9a5e14563feb941711d56b73f8","observation_id":"4d5a1ea1-65a1-4371-b8c7-ab92b984136f","resolution":{"observed_at":"2026-08-07T12:16:23.288396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.13538","last_updated":"2019-10-29T15:46:39Z","snapshot_observed_at":"2026-07-06T07:56:59.569184Z","submitted_at":"2019-05-27T10:40:40Z","title":"FUNSD: A Dataset for Form Understanding in Noisy Scanned Documents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.13538","snapshot_observed_at":"2026-08-07T12:16:23.358620Z","title":"FUNSD: A dataset for form understanding in noisy scanned documents.arXiv preprint arXiv:1905.13538, 2019","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:23.358620Z"},"links":{"cited_paper":"/paper/1905.13538","citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:fdbe58f33f4d232d3d252fea7519df6fdee568affbf91e5fc1a304971840c9e7","observation_id":"e3d8a4ee-d7b6-4213-a4f5-a3f1bce89de7","resolution":{"observed_at":"2026-08-07T12:16:23.358620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-07T12:16:23.446173Z","title":"Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik Narasimhan","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:23.446173Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:1389fa1a2a299a9d546b5d580b08d30c15dd591b29544f1c673450736eb7bbc0","observation_id":"f02b9289-7554-4051-ba3c-2161f2c635a1","resolution":{"observed_at":"2026-08-07T12:16:23.446173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13649","last_updated":"2024-06-06T02:01:09Z","snapshot_observed_at":"2026-08-05T16:01:54.847394Z","submitted_at":"2024-01-24T18:35:21Z","title":"VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13649","snapshot_observed_at":"2026-08-07T12:16:23.507875Z","title":"Visualwebarena: Evaluating multimodal agents on realistic visual web tasks.arXiv preprint arXiv:2401.13649, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:23.507875Z"},"links":{"cited_paper":"/paper/2401.13649","citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:4706a2a8bfbded4228c50aa22c84c7ba33946dc1eaea1dd78fe1e6275490db09","observation_id":"7c9e3463-166b-4613-881a-2dbfec41ae86","resolution":{"observed_at":"2026-08-07T12:16:23.507875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-07T12:16:23.619007Z","title":"Hoi, Steven C.˙Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models.arXiv preprint arXiv:2301.12597, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:23.619007Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:4217274b040a17ac6ce5e32922923c2e61c0703f92a1c9223fbda1d2d8978336","observation_id":"4d802964-4990-42c3-a3a9-833eac9fc557","resolution":{"observed_at":"2026-08-07T12:16:23.619007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T12:16:23.665196Z","title":"Torl: Scaling tool-integrated rl.arXiv preprint arXiv:2503.23383, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:23.665196Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:d739c7f109fadbaa96c0f6ca58e226091c6ce54a569dc653fd9de811cb04dbdb","observation_id":"f7e5c7f2-04d0-407f-88fc-59ac5af16301","resolution":{"observed_at":"2026-08-07T12:16:23.665196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-07T12:16:23.747374Z","title":"Visual instruction tuning.arXiv preprint arXiv:2304.08485, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:23.747374Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:a3526567537b86db0ddaa600cb4f46674b4ad01c121d61728e56a2c034212ffa","observation_id":"6adc218f-cc4e-4935-9596-8e6def33a041","resolution":{"observed_at":"2026-08-07T12:16:23.747374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03688","last_updated":"2025-10-04T03:54:18Z","snapshot_observed_at":"2026-08-06T20:36:41.418114Z","submitted_at":"2023-08-07T16:08:11Z","title":"AgentBench: Evaluating LLMs as Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03688","snapshot_observed_at":"2026-08-07T12:16:23.821960Z","title":"Agentbench: Evaluating LLMs as agents.arXiv preprint arXiv:2308.03688, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:23.821960Z"},"links":{"cited_paper":"/paper/2308.03688","citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:e5ead61b4f7efb5b0efaf5a7428256bef2b2bfb69e81564a41a4ef3e471c836d","observation_id":"085bd903-297a-4553-a88e-6c011123e860","resolution":{"observed_at":"2026-08-07T12:16:23.821960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:23.897548Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vision, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:23.897548Z"},"links":{"citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:7c5ace97c43f492cec003b3c7d495bcacb8839f42a805842990d7ec5994bb6a5","observation_id":"742ae582-6b3c-4111-ac23-744c6737e7d6","resolution":{"observed_at":"2026-08-07T12:16:23.897548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:24.009766Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:24.009766Z"},"links":{"citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:d9d958f8903a8863351dbf3582fee4f52e46cf54b06e9a9f45d886a09d109cdd","observation_id":"a88e7b80-dd04-41b1-a90f-4c9d997186d1","resolution":{"observed_at":"2026-08-07T12:16:24.009766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:29.359574Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":"891ba48a-5a93-43db-87b9-8fdab8a06532","year":2019},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:24.090500Z"},"links":{"citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:5a6cd83761baa3f77b248e1f235a6df4d0a53172242271133896af330c947df4","observation_id":"8cea61a5-de58-4ee5-a8a8-9174f04cd906","resolution":{"observed_at":"2026-08-07T12:16:29.419922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:29.258181Z","title":null,"venue":null,"work_id":"343702de-92a7-4f7e-a0eb-627e94c06e92","year":2021},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:24.177550Z"},"links":{"citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:5b9ed34cfb8f4408df4b22faf6c91a715b803050db5fa15885efede2d03a9b66","observation_id":"53e93438-613d-47f7-bda1-d00dd6bc3ef8","resolution":{"observed_at":"2026-08-07T12:16:29.297288Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:29.129883Z","title":"Browser use: Enable ai to control your browser, 2024","venue":null,"work_id":"77f871d1-f6d7-451a-909a-f2b540e339de","year":2024},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:24.252099Z"},"links":{"citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:cc9849b73733e3ab8d2b9ccb5233c62309176dfbcb3b65d576f534c321e100e4","observation_id":"bcd00016-d170-4464-abb1-30000aab1cf8","resolution":{"observed_at":"2026-08-07T12:16:29.192433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-07T17:14:39.278754Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-07T12:16:24.378965Z","title":"Webgpt: Browser- assisted question-answering with human feedback.arXiv preprint arXiv:2112.09332, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:24.378965Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:38dd7020a4b0eaa6a5240fc4250cd6ad22a3aa9e0ffdf38a0aec8f2fb46586d7","observation_id":"f3a0d1e3-f580-453e-beb9-1dfc4044fa32","resolution":{"observed_at":"2026-08-07T12:16:24.378965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:29.042223Z","title":"Deep-captcha: a deep learning based captcha solver for vulnerability assessment, 2020","venue":null,"work_id":"aa82b2f9-cae2-4ef3-8257-8a99d0eb9c1d","year":2020},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:24.467672Z"},"links":{"citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:901effa180518cfd10f17ef1d0be634be572180c119486448560ceea871e8106","observation_id":"c369baf7-f509-4b3b-9b3e-2e13c5623797","resolution":{"observed_at":"2026-08-07T12:16:29.084204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:28.919148Z","title":"Openai o3 and o4-mini system card","venue":null,"work_id":"2fe211bf-caa7-460a-a70e-04acb97b2fa8","year":null},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:24.581003Z"},"links":{"citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:296117735220f55e741ffdeb739830565c7804ec9d0ff09368ae218cf21e81ce","observation_id":"cbb6873c-85fa-4b90-b060-8caa652f0848","resolution":{"observed_at":"2026-08-07T12:16:28.977538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:28.587003Z","title":"Goucher, Adam Perelman, Aditya Ramesh, Aidan Clark, AJ Ostrow, Akila Welihinda, Alan Hayes, Alec Radford, Aleksander M ˛ adry, , et al","venue":null,"work_id":"b7a97631-62c1-4ff5-9dd4-110dabe80c5e","year":2024},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:24.772851Z"},"links":{"citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:6cd5334c007d01a606120ce2d2c7c67c9645a804bc724bf8bb610bb8058453ad","observation_id":"00261942-5dbe-4968-87d8-283ee522ff59","resolution":{"observed_at":"2026-08-07T12:16:28.674104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:28.784000Z","title":null,"venue":null,"work_id":"a1e8298a-e67f-4264-ad43-3c9879bed2ce","year":2025},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:24.679222Z"},"links":{"citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:3bbcd67ccb786d1b556e6002705f55ea333d67218e6b4d8f0100eb16f9451952","observation_id":"12e7a838-09c1-443a-ac54-c9d83c113092","resolution":{"observed_at":"2026-08-07T12:16:28.841033Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1105.2024","last_updated":"2011-11-03T16:45:47Z","snapshot_observed_at":"2026-08-06T06:47:44.072355Z","submitted_at":"2011-05-10T19:21:34Z","title":"Symbols of One-Loop Integrals From Mixed Tate Motives","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1105.2024","snapshot_observed_at":"2026-08-07T12:16:24.914755Z","title":"Breaking recaptchav2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:24.914755Z"},"links":{"cited_paper":"/paper/1105.2024","citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:4f39e82401c0c8463129bf017e0e06c5b7666d022acb1be43449f12c3e15fd91","observation_id":"29736ada-6fbe-413c-bfc1-7cd7b3432b3c","resolution":{"observed_at":"2026-08-07T12:16:24.914755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:28.442292Z","title":"Autoplan: Automatic planning of interactive decision-making tasks with large language models","venue":null,"work_id":"422a1db0-09ec-43f2-b552-033e4a6a7552","year":2023},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:24.857751Z"},"links":{"citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:9b0ddb3a77c0d7879c6454a23ac8f2abe47e38e1e1a7ff446e0438b7e82567f7","observation_id":"01e7ca81-d3a2-4dc8-af91-f8ea9b4dd923","resolution":{"observed_at":"2026-08-07T12:16:28.504648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13958","snapshot_observed_at":"2026-08-07T12:16:25.104200Z","title":"Toolrl: Reward is all tool learning needs.arXiv preprint arXiv:2504.13958, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:25.104200Z"},"links":{"cited_paper":"/paper/2504.13958","citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:da1cbfe703eda0b937628f40f66da142133915932349f907f1d6c9ec93bba32e","observation_id":"602fb106-998e-48e3-8e3c-78549edb9631","resolution":{"observed_at":"2026-08-07T12:16:25.104200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:28.276046Z","title":"Plummer, Liwei Wang, Cristina Cervantes, Juan C","venue":null,"work_id":"44f96214-4447-4eeb-9809-f0c0a674c25f","year":2015},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:25.011371Z"},"links":{"citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:9f1b221840e410cc147d04a9917e2707c2f5fd1f710003c40db65c5086ee20b3","observation_id":"774b04e1-77b9-4522-a558-b8866e1da4a4","resolution":{"observed_at":"2026-08-07T12:16:28.339740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:28.131314Z","title":"Autogpt: An autonomous gpt-4 experiment","venue":null,"work_id":"48779c7b-60b8-4fde-8a04-08ca4a9815a6","year":2023},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:25.302039Z"},"links":{"citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:3ab6f8f4d2f10ee7869d7c8d2408f786087ff95c4bb64f943f0c1305e60b869f","observation_id":"9c791ef3-4db7-4304-a588-3e1aef87e671","resolution":{"observed_at":"2026-08-07T12:16:28.185113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02810","last_updated":"2025-04-08T06:37:51Z","snapshot_observed_at":"2026-07-06T19:27:16.301809Z","submitted_at":"2024-09-21T05:54:35Z","title":"StateAct: Enhancing LLM Base Agents via Self-prompting and State-tracking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02810","snapshot_observed_at":"2026-08-07T12:16:25.216062Z","title":"Stateact: Enhancing llm base agents via self-prompting and state-tracking.arXiv preprint arXiv:2410.02810, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:25.216062Z"},"links":{"cited_paper":"/paper/2410.02810","citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:ca535c9b49e6b681856f5823c3b3f2710ce80ef6bdc540d8a37bc5062af3ca2b","observation_id":"6aa3af0b-9d82-40a7-9d69-c5b52652698d","resolution":{"observed_at":"2026-08-07T12:16:25.216062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:25.490284Z","title":"Partially observable markov decision processes","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:25.490284Z"},"links":{"citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:82a3e08dbc6c7a18a48ac4fba84a3852e5437010e9adf7f5d58a870c2edc5e7c","observation_id":"ee478595-f1e9-4889-9292-680e2f3b3052","resolution":{"observed_at":"2026-08-07T12:16:25.490284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:25.390603Z","title":"Towards vqa models that can read, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:25.390603Z"},"links":{"citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:677510dc161ff192b3c0e8c8bab7c843aa52485dcde351f2c5c3ff62aaa5ac5f","observation_id":"9a8f005a-2bfa-4f72-b3bb-f717f73a7e5f","resolution":{"observed_at":"2026-08-07T12:16:25.390603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:27.965428Z","title":"Phrasecut: Language grounding in images by text-based mask segmentation.ECCV, 2020","venue":null,"work_id":"a94083cf-62ce-4612-a2ab-6d8247bc4c98","year":2020},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:25.671645Z"},"links":{"citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:cb8d71828e8419023260198f0fd9b9aac753ba3af50ffa269eef8581b5823ca7","observation_id":"1d533068-f779-403b-b4fd-e6fedf97e8dd","resolution":{"observed_at":"2026-08-07T12:16:28.038738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16653","last_updated":"2023-05-26T05:52:27Z","snapshot_observed_at":"2026-07-06T15:33:45.900012Z","submitted_at":"2023-05-26T05:52:27Z","title":"AdaPlanner: Adaptive Planning from Feedback with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16653","snapshot_observed_at":"2026-08-07T12:16:25.568370Z","title":"Adaplanner: Adaptive planning from feedback with language models.arXiv preprint arXiv:2305.16653, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:25.568370Z"},"links":{"cited_paper":"/paper/2305.16653","citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:b0301e466d2f3fbebd0b60b6d936804208cb3668b94bb197407cec5ba9deb832","observation_id":"06cac098-554d-4f85-97d7-084e3f74b64f","resolution":{"observed_at":"2026-08-07T12:16:25.568370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-07T12:16:25.853689Z","title":"Mobile-agent: Autonomous multi-modal mobile device agent with visual perception","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:25.853689Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:9f813266623f35236820020b2d434e8edecc6a223bcf01dbfa5a903dd8d1c708","observation_id":"a70e694e-7803-4b19-a508-f58b603a9a32","resolution":{"observed_at":"2026-08-07T12:16:25.853689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16291","last_updated":"2023-10-19T16:27:03Z","snapshot_observed_at":"2026-08-07T08:29:46.650400Z","submitted_at":"2023-05-25T17:46:38Z","title":"Voyager: An Open-Ended Embodied Agent with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16291","snapshot_observed_at":"2026-08-07T12:16:25.770961Z","title":"V oyager: An open-ended embodied agent with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:25.770961Z"},"links":{"cited_paper":"/paper/2305.16291","citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:41447b3124320d079e6efdac2f2464389f4f76d5ca79ba0ce1a20a93040cd063","observation_id":"a684f4db-af1e-4cbd-9758-0b86697091d1","resolution":{"observed_at":"2026-08-07T12:16:25.770961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:26.066956Z","title":"An illusion of progress? assessing the current state of web agents.arXiv preprint arXiv:2504.01382, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:26.066956Z"},"links":{"citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:b14a4fe437cc653600f3140dd2f66122098b9b7c5fa23896fa607a599bbf6585","observation_id":"7c0b0e93-0804-4c73-af47-4ef6676fbd90","resolution":{"observed_at":"2026-08-07T12:16:26.066956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T12:16:25.977120Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:25.977120Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:3058e94cc7e374b330ac77e8d02c5a0e16fee042e9268f5fd819d82cf6dd067e","observation_id":"aeaf88a7-c605-4ead-ae1a-6f075e29978e","resolution":{"observed_at":"2026-08-07T12:16:25.977120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-07T12:16:26.288484Z","title":"React: Synergizing reasoning and acting in language models.arXiv preprint arXiv:2210.03629, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:26.288484Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:cdcdc860da68c85552476ed01438a515409fe9ef6d6b0c8ba0c075fc82271a6d","observation_id":"3be8dd6d-a812-4ac5-920a-78dbcd120b33","resolution":{"observed_at":"2026-08-07T12:16:26.288484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:27.778348Z","title":"An illusion of progress? assessing the current state of web agents, 2025","venue":null,"work_id":"1f830b60-03e4-455b-a770-141ce9917274","year":2025},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:26.170273Z"},"links":{"citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:3bd8d032374d74a8400412a8e7c4b3326fa8ebbd70f8c89b7e61a15b2902f2c1","observation_id":"1bd161c2-6d3c-4a36-99b9-a4db26cae643","resolution":{"observed_at":"2026-08-07T12:16:27.859356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:27.437143Z","title":"Berg, and Tamara L","venue":null,"work_id":"9cc9f7d2-5761-4583-9b6f-bbf06387b0b5","year":2016},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:26.499271Z"},"links":{"citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:d6eb9ba4a851a309d581662ae2c83cdb2207d658bec86baddff76aed870d74c8","observation_id":"ceaa361b-e936-4422-af1b-2d0fb9da548e","resolution":{"observed_at":"2026-08-07T12:16:27.494034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:27.607352Z","title":"Survey on evaluation of llm-based agents, 2025","venue":null,"work_id":"4ec61639-dbeb-406c-9578-c041e2d94b14","year":2025},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:26.402569Z"},"links":{"citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:61239a0855d9bd7bbf7822236f45e79cda8c81c012636c4b94a6c8bc434fb37f","observation_id":"24ae8380-6409-4b5b-8208-233f31bdc736","resolution":{"observed_at":"2026-08-07T12:16:27.702921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:26.677705Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:26.677705Z"},"links":{"citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:c738454161df4227fcf86510dbe057fcbba3a4596726c63f57df18e115a15c11","observation_id":"162ccc53-e690-435f-88a0-cef2f6fc6705","resolution":{"observed_at":"2026-08-07T12:16:26.677705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-06T13:03:19.727877Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-07T12:16:26.604788Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:26.604788Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:77b18d05033e5610f0904da53b7b5001ee46fc9d62036f8f6e35696ac75f78f3","observation_id":"7a051344-355f-4ef5-83e4-820e08d2ce20","resolution":{"observed_at":"2026-08-07T12:16:26.604788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.07836","last_updated":"2019-08-16T00:40:08Z","snapshot_observed_at":"2026-07-06T08:15:50.182975Z","submitted_at":"2019-08-16T00:40:08Z","title":"PubLayNet: largest dataset ever for document layout analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.07836","snapshot_observed_at":"2026-08-07T12:16:26.842977Z","title":"PubLayNet: Largest dataset ever for document layout analysis.arXiv preprint arXiv:1908.07836, 2019","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:26.842977Z"},"links":{"cited_paper":"/paper/1908.07836","citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:a5fc9e6aff76d5f914acadc1fd2cf9454621126f10732beeb1da3b4228374e40","observation_id":"5e1f3d13-c12b-43b4-ae24-d0ae1f1b2938","resolution":{"observed_at":"2026-08-07T12:16:26.842977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-07T15:59:20.025064Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-07T12:16:26.754466Z","title":"Nemotron-research-tool-n1: Tool-using language models with reinforced reasoning.arXiv preprint arXiv:2505.00024, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:26.754466Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:91657e4d19776e8aa23a7a838cecb9bc565f828f8fa0874ef00aba799846f5f3","observation_id":"7932a883-2bfe-4888-803c-20a7cea739a8","resolution":{"observed_at":"2026-08-07T12:16:26.754466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T12:16:27.016316Z","title":"✓” indicates that the model demonstrated at least partial success on that type, while “✗","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:27.016316Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:c712ebf065fa688cc2a1fac8515ee6d9f12ce7825ca2a3c7e129fd34ce7b4680","observation_id":"b0ebfb9b-12ba-458b-a62c-90823959b5cb","resolution":{"observed_at":"2026-08-07T12:16:27.016316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13854","last_updated":"2024-04-16T15:13:18Z","snapshot_observed_at":"2026-08-06T12:47:01.809185Z","submitted_at":"2023-07-25T22:59:32Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13854","snapshot_observed_at":"2026-08-07T12:16:26.935337Z","title":"Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried, Uri Alon, and Graham Neubig","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:26.935337Z"},"links":{"cited_paper":"/paper/2307.13854","citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:c673eb2f073716eb6f3d45df58e3a7a51b1faae4d061c4159163f25aa4cf55a0","observation_id":"6a82974c-ce36-409f-a4b8-61390314f9de","resolution":{"observed_at":"2026-08-07T12:16:26.935337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:29.658236Z","title":null,"venue":null,"work_id":"571ece31-7a7a-4c6e-b212-7bfe619dd254","year":2025},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:22.800470Z"},"links":{"citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:4399c6e436cd64a3acf72cbaed0b546a177b74b723b5b7b7bdcb6633f2baf69a","observation_id":"3a877dd6-c95b-48b8-94c7-068352c75590","resolution":{"observed_at":"2026-08-07T12:16:29.739225Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":38,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 4 inbound Pith citation observations for arXiv:2505.24878."}