{"as_of":"2026-08-07T20:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7aaaabf7d2af23dc95eb3e7da207849882ff7e290a3b90e34fff28cdce5b8ffb","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T01:19:32.406859Z","state":"measured"},{"denominator":168,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":168,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":131,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:06:57.471803Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":5,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2401.05459","last_updated":"2024-05-08T06:16:23Z","snapshot_observed_at":"2026-08-02T13:57:57.119489Z","submitted_at":"2024-01-10T09:25:45Z","title":"Personal LLM Agents: Insights and Survey about the Capability, Efficiency and Security","version":2},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-05-17T00:57:26.303195Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2401.05459"},"observation_digest":"sha256:2a93e6731e77c73bffee5b8f4078a6183319faefc958dcb6ba668e6442be5392","observation_id":"45ea4ba0-8ec6-4a0d-ab76-d0b674236c40","resolution":{"observed_at":"2026-05-17T00:57:26.848568Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2405.14573","last_updated":"2025-04-06T20:37:50Z","snapshot_observed_at":"2026-08-07T08:11:20.950548Z","submitted_at":"2024-05-23T13:48:54Z","title":"AndroidWorld: A Dynamic Benchmarking Environment for Autonomous Agents","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T12:06:13.697487Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2405.14573"},"observation_digest":"sha256:20d632d411994170311c384727885584f81b1dc1f9f289b3f981a8cb6039b30c","observation_id":"c16d6729-7ab8-46b5-a2b8-dd7129eb580a","resolution":{"observed_at":"2026-05-13T12:06:13.844846Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2406.12373","last_updated":"2024-07-16T06:19:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-18T07:58:33Z","title":"WebCanvas: Benchmarking Web Agents in Online Environments","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T11:29:14.918147Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2406.12373"},"observation_digest":"sha256:2d93fb8590f76ba9405d62863b57f7323badd017aeef846a8865069bef14a054","observation_id":"5bd9de76-5195-4c14-9699-a4e4fd35a489","resolution":{"observed_at":"2026-05-20T11:29:14.970132Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2410.23218","last_updated":"2024-10-30T17:10:19Z","snapshot_observed_at":"2026-08-05T06:30:40.974506Z","submitted_at":"2024-10-30T17:10:19Z","title":"OS-ATLAS: A Foundation Action Model for Generalist GUI Agents","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-13T09:29:27.173784Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2410.23218"},"observation_digest":"sha256:4e166961081067267938d5cf5ec40354f951130358d5523bc84970bfa71b9507","observation_id":"37237622-eb7b-46d3-9022-4158bb0f1338","resolution":{"observed_at":"2026-05-13T09:29:27.553165Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2412.04454","last_updated":"2025-05-05T16:17:20Z","snapshot_observed_at":"2026-07-06T20:02:21.509050Z","submitted_at":"2024-12-05T18:58:26Z","title":"Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction","version":2},"reference_index":113,"source":"arxiv_source","source_observed_at":"2026-05-18T04:09:41.494136Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2412.04454"},"observation_digest":"sha256:8378b9eb37d23d421d016d6bd1a304dd6daa135565a114ec57480dabd3a524ab","observation_id":"7e9468d6-8aba-438c-8163-6259e7782567","resolution":{"observed_at":"2026-05-18T04:09:41.649412Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2501.16150","last_updated":"2026-03-27T07:41:10Z","snapshot_observed_at":"2026-08-02T22:37:46.736145Z","submitted_at":"2025-01-27T15:44:02Z","title":"A Comprehensive Survey of Agents for Computer Use: Foundations, Challenges, and Future Directions","version":3},"reference_index":173,"source":"pdf_text","source_observed_at":"2026-05-23T04:59:36.994758Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2501.16150"},"observation_digest":"sha256:8a7222e564e57cdda81db084c105f9829e15d8f464be045fc0d8d58a468e7830","observation_id":"3665c22e-0717-461b-b0bb-7f9dec2a447c","resolution":{"observed_at":"2026-05-23T05:02:35.561245Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2503.09572","last_updated":"2025-04-22T17:56:22Z","snapshot_observed_at":"2026-08-07T20:22:20.692339Z","submitted_at":"2025-03-12T17:40:52Z","title":"Plan-and-Act: Improving Planning of Agents for Long-Horizon Tasks","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-17T21:32:18.491541Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2503.09572"},"observation_digest":"sha256:fe09ad30bdff3bdb6d8a6ce41b7d4c1714e557e22d0b6eda98f0fa702a259f19","observation_id":"1dffd54f-cb0c-4994-b4ac-68bbdd7cb12c","resolution":{"observed_at":"2026-05-17T21:32:18.687785Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2504.21798","last_updated":"2025-05-21T17:21:45Z","snapshot_observed_at":"2026-07-06T21:17:09.837496Z","submitted_at":"2025-04-30T16:56:06Z","title":"SWE-smith: Scaling Data for Software Engineering Agents","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T10:22:06.951531Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2504.21798"},"observation_digest":"sha256:10ea7fd346e67541848caa9589c2f803e08431f7dcd79c91996b166edbb3cb94","observation_id":"a935f98a-3274-46e4-9fc8-32e1a2850359","resolution":{"observed_at":"2026-05-15T10:22:06.984822Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-07T14:06:57.471803Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-07T13:58:47.917936Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:57.471803Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:9dbb489f72325a231063badfd069e95be3de87a353bb46dd5a22a0289f1991f3","observation_id":"e4804db6-1420-4297-ba88-d5c0bbe94f67","resolution":{"observed_at":"2026-08-07T14:06:57.471803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-07T11:40:58.052425Z","title":"Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01716","last_updated":"2025-06-02T14:23:33Z","snapshot_observed_at":"2026-08-07T11:32:42.184077Z","submitted_at":"2025-06-02T14:23:33Z","title":"Self-Challenging Language Model Agents","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:58.052425Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2506.01716"},"observation_digest":"sha256:0462d0e87d1bd846c04de31c1a5cb36e773a34632834d5eae1170c0371d0a7b6","observation_id":"e54719fc-d061-4af5-b4c3-0d10d14eea7c","resolution":{"observed_at":"2026-08-07T11:40:58.052425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-07T11:30:56.287971Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02298","last_updated":"2025-06-02T22:36:02Z","snapshot_observed_at":"2026-08-07T11:24:30.549048Z","submitted_at":"2025-06-02T22:36:02Z","title":"LAM SIMULATOR: Advancing Data Generation for Large Action Model Training via Online Exploration and Trajectory Feedback","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:56.287971Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2506.02298"},"observation_digest":"sha256:f0ad2db9c4e2b8f1b73b500497bcda9c77dde96ca015f33e3658bf7a9daea54c","observation_id":"ba39a1fd-be63-4687-abeb-baa85f06085d","resolution":{"observed_at":"2026-08-07T11:30:56.287971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-07T12:11:25.259960Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05376","last_updated":"2025-06-09T05:48:22Z","snapshot_observed_at":"2026-08-07T12:39:09.825243Z","submitted_at":"2025-05-30T22:58:54Z","title":"A Red Teaming Roadmap Towards System-Level Safety","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:25.259960Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2506.05376"},"observation_digest":"sha256:c1b869d502426cb58b0b81bf2f708ed794345d0ff7629505a75e263f692fd1e5","observation_id":"a4dbe174-a48d-4b6f-b2f3-a242b1104d8a","resolution":{"observed_at":"2026-08-07T12:11:25.259960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-07T05:02:29.285064Z","title":"J., Cheng, Z., Shin, D., Lei, F., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08933","last_updated":"2025-06-10T15:59:38Z","snapshot_observed_at":"2026-08-07T04:56:29.533924Z","submitted_at":"2025-06-10T15:59:38Z","title":"What Limits Virtual Agent Application? OmniBench: A Scalable Multi-Dimensional Benchmark for Essential Virtual Agent Capabilities","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T05:02:29.285064Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2506.08933"},"observation_digest":"sha256:a7675c6fed974d038cbdb4f7e13febf5000006772173ba390db3fcdafb09b3c9","observation_id":"bb747de6-b1f3-453e-8a2f-ccdbc3835f84","resolution":{"observed_at":"2026-08-07T05:02:29.285064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-07T04:16:08.492855Z","title":"Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments.ArXiv, abs/2404.07972, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.492855Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:51ebc03c9905250e53466a5cdb79230aa15389d663df28d1dc854d0ec0755541","observation_id":"e082b267-d4f3-424e-adf6-f4a1d9132bfd","resolution":{"observed_at":"2026-08-07T04:16:08.492855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-07T00:41:18.569925Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13205","last_updated":"2025-09-05T14:19:03Z","snapshot_observed_at":"2026-08-07T00:34:38.756010Z","submitted_at":"2025-06-16T08:09:32Z","title":"Poison Once, Control Anywhere: Clean-Text Visual Backdoors in VLM-based Mobile Agents","version":6},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T00:41:18.569925Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2506.13205"},"observation_digest":"sha256:d2a618f770438ee24f834d40698b9aac6519d6282898142d342b9f6a1d46b283","observation_id":"bc31b950-ecb2-4d67-aa18-e3b9c59d6dfd","resolution":{"observed_at":"2026-08-07T00:41:18.569925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-06T23:26:56.979221Z","title":"Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18096","last_updated":"2025-09-03T15:32:23Z","snapshot_observed_at":"2026-08-06T23:20:46.744749Z","submitted_at":"2025-06-22T16:52:48Z","title":"Deep Research Agents: A Systematic Examination And Roadmap","version":2},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-08-06T23:26:56.979221Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2506.18096"},"observation_digest":"sha256:505fd6f69786252a995a46663fb865663d849f337dfef56b73ada4d188173c1f","observation_id":"f556dbea-3f9c-4423-b125-323b58224c3e","resolution":{"observed_at":"2026-08-06T23:26:56.979221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-06T22:36:44.585127Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:44.585127Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:ce07524962c97e1aa4533b6626dc6d7b48643106d1703018b09be00a44a49371","observation_id":"eac92648-2a35-4996-8114-fa90e82c1a78","resolution":{"observed_at":"2026-08-06T22:36:44.585127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-06T18:19:58.348232Z","title":"Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08719","last_updated":"2025-07-11T16:19:53Z","snapshot_observed_at":"2026-08-07T04:09:15.037517Z","submitted_at":"2025-07-11T16:19:53Z","title":"Multilingual Multimodal Software Developer for Code Generation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.348232Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2507.08719"},"observation_digest":"sha256:c7b1d3f03d183832faafe089d196ec007035af7799b3bff7c95c1d85227e359e","observation_id":"6b19a5cd-06d0-4230-b831-f8dc0a7641ca","resolution":{"observed_at":"2026-08-06T18:19:58.348232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-06T16:46:01.738182Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12806","last_updated":"2025-08-01T22:37:16Z","snapshot_observed_at":"2026-08-06T16:35:50.892428Z","submitted_at":"2025-07-17T05:46:27Z","title":"MCPEval: Automatic MCP-based Deep Evaluation for AI Agent Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T16:46:01.738182Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2507.12806"},"observation_digest":"sha256:c11eb811ba1642ca47b92746d1cacd8d4cc411239c0b79a474f2c85391675ac8","observation_id":"6aaf830b-3ec9-4809-b1b8-55ab9db3030f","resolution":{"observed_at":"2026-08-06T16:46:01.738182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-06T16:14:04.352421Z","title":"Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14295","last_updated":"2025-08-22T16:49:10Z","snapshot_observed_at":"2026-08-07T14:03:43.498386Z","submitted_at":"2025-07-18T18:07:38Z","title":"A Simple \"Try Again\" Can Elicit Multi-Turn LLM Reasoning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T16:14:04.352421Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2507.14295"},"observation_digest":"sha256:60d18649789b7430e607700d9a4617d94ff58b591121a0358e6dfa20d430cb15","observation_id":"7a687a27-e2c6-419d-8403-c693e0e42247","resolution":{"observed_at":"2026-08-06T16:14:04.352421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-06T11:52:12.346411Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22358","last_updated":"2025-07-30T03:49:14Z","snapshot_observed_at":"2026-08-07T14:55:21.236227Z","submitted_at":"2025-07-30T03:49:14Z","title":"Magentic-UI: Towards Human-in-the-loop Agentic Systems","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T11:52:12.346411Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2507.22358"},"observation_digest":"sha256:802cbb82d9ed964ddde086f8b82a6a925afa030676b0184c4720fad4c851275c","observation_id":"86cee43f-b5a5-47e1-bf96-ee4e1c71595f","resolution":{"observed_at":"2026-08-06T11:52:12.346411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-04T22:55:20.925734Z","title":"Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07098","last_updated":"2025-09-08T18:00:12Z","snapshot_observed_at":"2026-08-06T13:09:11.566705Z","submitted_at":"2025-09-08T18:00:12Z","title":"Instruction Agent: Enhancing Agent with Expert Demonstration","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T22:55:20.925734Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2509.07098"},"observation_digest":"sha256:6282ae98fd87f4495fc0d18dbe958dab23d4211b24c5c16142869075196b2596","observation_id":"0b202f99-2d90-468a-bb16-4eeb23db8f52","resolution":{"observed_at":"2026-08-04T22:55:20.925734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-04T11:31:10.146970Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04452","last_updated":"2026-07-28T07:01:45Z","snapshot_observed_at":"2026-08-06T15:24:50.385451Z","submitted_at":"2025-10-06T02:58:42Z","title":"Understanding User Experiences of Computer Use Agents: Design Space and Opportunities for Building Agent UX Prototypes","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T11:31:10.146970Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2510.04452"},"observation_digest":"sha256:bf2879eb25f45f9c8e89944ca82e006b17c1fcea36557040dab5294bcbc3f9c4","observation_id":"f8cafdc6-f760-4ca0-9b38-f5bee3d790f5","resolution":{"observed_at":"2026-08-04T11:31:10.146970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-04T11:32:15.101569Z","title":"arXiv preprint arXiv:2404.07972","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.04514","last_updated":"2026-06-08T20:02:58Z","snapshot_observed_at":"2026-08-04T11:32:07.464063Z","submitted_at":"2025-10-06T06:05:36Z","title":"ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T11:32:15.101569Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2510.04514"},"observation_digest":"sha256:cabc5a3885d3a22b39b0153d9a1af432d6b4709b7d48414fab8b7fde653fa7db","observation_id":"07be4d4d-cc99-4fee-9539-94cc41f6ed51","resolution":{"observed_at":"2026-08-04T11:32:15.101569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-03T12:10:24.865140Z","title":"strong positive transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.04126","last_updated":"2026-06-30T13:54:32Z","snapshot_observed_at":"2026-08-03T12:10:23.636506Z","submitted_at":"2026-01-07T17:40:08Z","title":"InfiniteWeb: Scalable Web Environment Synthesis for GUI Agent Training","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T12:10:24.865140Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2601.04126"},"observation_digest":"sha256:7ece1335cd334ff1c9a7e185fe833001e7c6c3f60b04ac29b02c6b8dbed8f113","observation_id":"aa8ca01e-9cc6-4fbd-9d53-a162f0550e2c","resolution":{"observed_at":"2026-08-03T12:10:24.865140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-03T06:48:32.428948Z","title":"OSWorld : Benchmarking multimodal agents for open-ended tasks in real computer environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22136","last_updated":"2026-07-07T06:58:47Z","snapshot_observed_at":"2026-08-03T15:20:06.855520Z","submitted_at":"2026-01-29T18:55:46Z","title":"StepShield: When, Not Whether to Intervene on Rogue Agents","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-03T06:48:32.428948Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2601.22136"},"observation_digest":"sha256:1f4ac78f6b44f008fafc2b724d55dcda99a8f113715d23875278bca133c730b2","observation_id":"d97c84ab-9c89-45ed-be05-c2d32f2cf919","resolution":{"observed_at":"2026-08-03T06:48:32.428948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2602.00933","last_updated":"2026-05-19T23:26:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-31T23:19:39Z","title":"MCP-Atlas: A Large-Scale Benchmark for Tool-Use Competency with Real MCP Servers","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T08:28:16.904091Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2602.00933"},"observation_digest":"sha256:f2e975cda3f0f5963226b6a98004482a54dae3fd027d310c7a75cf9130251c3c","observation_id":"904a1599-9831-48bb-94b2-36ee6e0795b0","resolution":{"observed_at":"2026-05-16T08:30:45.607360Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2602.00933","last_updated":"2026-05-19T23:26:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-31T23:19:39Z","title":"MCP-Atlas: A Large-Scale Benchmark for Tool-Use Competency with Real MCP Servers","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T15:10:04.253250Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2602.00933"},"observation_digest":"sha256:263fc7424bdaa746b0cdadc5e979ecea6cf45056f6368585b524164c5aff08d6","observation_id":"71f09531-1f2b-40d1-bb63-9db123bdb778","resolution":{"observed_at":"2026-05-21T15:10:16.464451Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-10T16:09:05.225767Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2602.02276"},"observation_digest":"sha256:7990d3dde88b5f625248a6d72a75fff53a0e4cc5eb073bc3c13d51a1ee438ec8","observation_id":"e5540bf1-04d1-4ece-bd63-ead3acd460e1","resolution":{"observed_at":"2026-05-13T01:19:32.642608Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-02T23:32:14.009549Z","title":"Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.13692","last_updated":"2026-06-30T17:19:18Z","snapshot_observed_at":"2026-08-02T23:32:10.162628Z","submitted_at":"2026-02-14T09:26:41Z","title":"ThunderAgent: A Simple, Fast and Program-Aware Agentic Inference System","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T23:32:14.009549Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2602.13692"},"observation_digest":"sha256:22c7cc00b17a0ff24be8e80456239ae8e0b3a0ed065f3db7c23e113a28c6eb3b","observation_id":"fc6ada6d-7735-42f7-a4ac-6ac66b0584ba","resolution":{"observed_at":"2026-08-02T23:32:14.009549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2602.20867","last_updated":"2026-02-24T13:11:38Z","snapshot_observed_at":"2026-07-29T17:42:23.433838Z","submitted_at":"2026-02-24T13:11:38Z","title":"SoK: Agentic Skills -- Beyond Tool Use in LLM Agents","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-14T23:19:31.024268Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2602.20867"},"observation_digest":"sha256:6650174a534d7ccf2e034e8b876b02a5e6d713cd5b9d7f0270cd1746f40c9d13","observation_id":"a91f53af-6f4a-4505-a425-5dca60de01fa","resolution":{"observed_at":"2026-05-14T23:19:31.260996Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2603.14987","last_updated":"2026-05-21T06:24:06Z","snapshot_observed_at":"2026-08-03T21:30:30.993382Z","submitted_at":"2026-03-16T08:51:33Z","title":"Beyond Benchmark Islands: Toward Representative Trustworthiness Evaluation for Agentic AI","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T10:19:56.003219Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2603.14987"},"observation_digest":"sha256:fada51008b7282b071a318fa06d7baec86d37350ef28ace6005f59e02c7ae599","observation_id":"abcc432b-10f2-4292-80d0-40da3a898ca6","resolution":{"observed_at":"2026-05-22T10:21:23.252058Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2603.21362","last_updated":"2026-05-10T14:58:22Z","snapshot_observed_at":"2026-08-02T21:54:03.300066Z","submitted_at":"2026-03-22T18:47:34Z","title":"AdaRubric: Task-Adaptive Rubrics for Reliable LLM Agent Evaluation and Reward Learning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T06:45:59.036473Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2603.21362"},"observation_digest":"sha256:6d35ecc106fe848ed31ea51e40cd6df32224f3b9d4b667de87b562144b5195f0","observation_id":"8c213217-51ad-4a18-8c99-a06869988851","resolution":{"observed_at":"2026-05-15T06:49:49.335166Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2603.23964","last_updated":"2026-04-13T08:15:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-25T05:56:54Z","title":"From Pixels to Digital Agents: An Empirical Study on the Taxonomy and Technological Trends of Reinforcement Learning Environments","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-15T01:20:03.181903Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2603.23964"},"observation_digest":"sha256:b57b4eabeccfddfe7522082532728d77015f261c56bb77f2969691535e2b403a","observation_id":"298b6312-b1f0-4571-95a8-d2461734e9fc","resolution":{"observed_at":"2026-05-15T01:23:27.095484Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2604.05157","last_updated":"2026-05-28T08:13:55Z","snapshot_observed_at":"2026-07-13T09:34:35.793287Z","submitted_at":"2026-04-06T20:39:30Z","title":"IntentScore: Intent-Conditioned Action Evaluation for Computer-Use Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T19:08:21.527478Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2604.05157"},"observation_digest":"sha256:b9df7fecdf4ad25ef3f69dcba04e5e2c89a61608057f1b3b82b6432c9323aec4","observation_id":"8633bda4-be3a-45df-84ff-f2516609ef69","resolution":{"observed_at":"2026-05-13T01:19:32.642608Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2604.05157","last_updated":"2026-05-28T08:13:55Z","snapshot_observed_at":"2026-07-13T09:34:35.793287Z","submitted_at":"2026-04-06T20:39:30Z","title":"IntentScore: Intent-Conditioned Action Evaluation for Computer-Use Agents","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-25T06:56:56.794206Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2604.05157"},"observation_digest":"sha256:aecfb3a4e0f695bf9509b8acd3536cb522583be02346b154e9c803b820be1c71","observation_id":"44285b12-253b-4eb4-a757-3f1a25d360d0","resolution":{"observed_at":"2026-05-25T07:00:27.121649Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2604.05912","last_updated":"2026-04-07T14:15:45Z","snapshot_observed_at":"2026-08-07T05:35:01.907926Z","submitted_at":"2026-04-07T14:15:45Z","title":"FrontierFinance: A Long-Horizon Computer-Use Benchmark of Real-World Financial Tasks","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-10T19:49:32.983778Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2604.05912"},"observation_digest":"sha256:144ace3ef0a7d426e7533592c05fba32d83e60f7892671a3ec0cfd43e6e57811","observation_id":"40057c14-2a2d-40d2-ba8a-dc9ed847dd4d","resolution":{"observed_at":"2026-05-13T01:19:32.642608Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2604.07929","last_updated":"2026-04-09T07:49:02Z","snapshot_observed_at":"2026-07-06T22:57:09.435331Z","submitted_at":"2026-04-09T07:49:02Z","title":"Same Outcomes, Different Journeys: A Trace-Level Framework for Comparing Human and GUI-Agent Behavior in Production Search Systems","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T18:22:52.879124Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2604.07929"},"observation_digest":"sha256:7eccfb25b63846994c6b498f8b5248fe25ff7ddc7fd7cad68036808bfbb56f32","observation_id":"2398afb7-84a7-4154-aee6-5a595908d505","resolution":{"observed_at":"2026-05-13T01:19:32.642608Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2604.08516","last_updated":"2026-04-09T17:54:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:54:02Z","title":"MolmoWeb: Open Visual Web Agent and Open Data for the Open Web","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T18:00:34.401698Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2604.08516"},"observation_digest":"sha256:9a6a4e6f00fd3a83b5db339d3fac3d0c74401e8ac45f9ef195ab772377fc34a8","observation_id":"032d5d0a-5811-4825-a3f9-abe5baaeae9f","resolution":{"observed_at":"2026-05-13T01:19:32.642608Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2604.08988","last_updated":"2026-05-24T11:57:07Z","snapshot_observed_at":"2026-07-31T18:18:27.141819Z","submitted_at":"2026-04-10T05:49:50Z","title":"SEA-Eval: A Benchmark for Evaluating Self-Evolving Agents Beyond Episodic Assessment","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T17:52:08.991150Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2604.08988"},"observation_digest":"sha256:5b7153f28e3dddf5aced0db7577410644dbe680d38bc475376e901343acb4c83","observation_id":"cc198b38-781f-46a9-af33-525685b05aeb","resolution":{"observed_at":"2026-05-13T01:19:32.642608Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-07-12T23:36:55.286437Z","title":"InFind- ings of the Association for Computational Linguistics: ACL 2025, pages 3350–3376","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.08988","last_updated":"2026-05-24T11:57:07Z","snapshot_observed_at":"2026-07-31T18:18:27.141819Z","submitted_at":"2026-04-10T05:49:50Z","title":"SEA-Eval: A Benchmark for Evaluating Self-Evolving Agents Beyond Episodic Assessment","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T23:36:55.286437Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2604.08988"},"observation_digest":"sha256:f03ce7e25301d29ce92ac3446270f72d38cf9a5ab1f036ad39c19d20f227ca0e","observation_id":"ecc082ca-81bb-41b2-aee2-eddc131da08c","resolution":{"observed_at":"2026-07-12T23:36:55.286437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2604.10352","last_updated":"2026-04-11T21:38:15Z","snapshot_observed_at":"2026-08-05T23:40:26.474902Z","submitted_at":"2026-04-11T21:38:15Z","title":"ClawVM: Harness-Managed Virtual Memory for Stateful Tool-Using LLM Agents","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:07.187666Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2604.10352"},"observation_digest":"sha256:2ddb0f30e804fcc1f8e51fecca6854ab0ccde499af6907128b6fdd41744e86b1","observation_id":"6d2c8c00-37d3-4151-941b-2e26111b9c2e","resolution":{"observed_at":"2026-05-13T01:19:32.642608Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2604.12162","last_updated":"2026-04-14T00:43:20Z","snapshot_observed_at":"2026-07-31T20:58:59.645474Z","submitted_at":"2026-04-14T00:43:20Z","title":"AlphaEval: Evaluating Agents in Production","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T16:30:51.886471Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2604.12162"},"observation_digest":"sha256:e802b48d087d76cb569171f763a1310fdd4bfc8b0b42165b564fc2380e0f941d","observation_id":"ee85e413-d8c0-4d3b-8823-d78918b9f5f4","resolution":{"observed_at":"2026-05-13T01:19:32.642608Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2604.14262","last_updated":"2026-07-01T10:12:28Z","snapshot_observed_at":"2026-07-12T20:25:38.300915Z","submitted_at":"2026-04-15T16:39:22Z","title":"GUI-Perturbed: Domain Randomization Reveals Systematic Brittleness in GUI Grounding Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T13:39:15.820777Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2604.14262"},"observation_digest":"sha256:d4bedbe62416a325c52bdece5e575f77ee04192227e83062b3f018dd6869eb0d","observation_id":"49a3dcac-b105-4d31-93ad-642ccc14491b","resolution":{"observed_at":"2026-05-13T01:19:32.642608Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-07-12T20:25:41.773345Z","title":"Xie et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.14262","last_updated":"2026-07-01T10:12:28Z","snapshot_observed_at":"2026-07-12T20:25:38.300915Z","submitted_at":"2026-04-15T16:39:22Z","title":"GUI-Perturbed: Domain Randomization Reveals Systematic Brittleness in GUI Grounding Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T20:25:41.773345Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2604.14262"},"observation_digest":"sha256:e0136d0658d9148309b07078630d67b46cd649a868d8bf9240f3726495e21184","observation_id":"c6e0dfde-0040-4693-b42e-d6b1c9497225","resolution":{"observed_at":"2026-07-12T20:25:41.773345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2604.14668","last_updated":"2026-04-16T06:22:48Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T06:22:48Z","title":"Beyond Chat and Clicks: GUI Agents for In-Situ Assistance via Live Interface Transformation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T11:19:54.809577Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2604.14668"},"observation_digest":"sha256:e3f0995f17d62b5721aec9e2fbce0f749523dbc6a4bafdd58b4035bfb9410f9c","observation_id":"acf8215c-e671-43dd-b4bf-76b79fdcf04b","resolution":{"observed_at":"2026-05-13T01:19:32.642608Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2604.15136","last_updated":"2026-04-16T15:15:58Z","snapshot_observed_at":"2026-07-06T23:02:44.990811Z","submitted_at":"2026-04-16T15:15:58Z","title":"Feedback-Driven Execution for LLM-Based Binary Analysis","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T10:40:32.133423Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2604.15136"},"observation_digest":"sha256:f009f5179c0e79979aced18e8fd7f928df6af5c6e0c0967cce99d56a311bfaa3","observation_id":"b2fd0831-55c3-4b44-bcee-94bf73eab6a7","resolution":{"observed_at":"2026-05-13T01:19:32.642608Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2604.16007","last_updated":"2026-04-17T12:29:54Z","snapshot_observed_at":"2026-07-06T23:03:26.308324Z","submitted_at":"2026-04-17T12:29:54Z","title":"MemExplorer: Navigating the Heterogeneous Memory Design Space for Agentic Inference NPUs","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T07:45:17.043107Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2604.16007"},"observation_digest":"sha256:1b9cdf996e28b405b804af61b57772b28d68c02006878ab54d61e1fb36df1094","observation_id":"bcd0509b-45db-4e80-9215-df0592d69242","resolution":{"observed_at":"2026-05-13T01:19:32.642608Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2604.17989","last_updated":"2026-04-20T09:12:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T09:12:47Z","title":"AIT Academy: Cultivating the Complete Agent with a Confucian Three-Domain Curriculum","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T05:08:54.560648Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2604.17989"},"observation_digest":"sha256:30e91b564992df1fbceb1412023b09068b08a540db0fde3b81eec824bf0c66ed","observation_id":"1a843195-225a-4412-b517-bfb9ca7bb020","resolution":{"observed_at":"2026-05-13T01:19:32.642608Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2604.18292","last_updated":"2026-04-20T14:01:10Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:01:10Z","title":"Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence","version":1},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-05-10T05:24:00.503836Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2604.18292"},"observation_digest":"sha256:545190f8842a63011188b8cf214a0c44866c3a1a60af2efece40c090a4375502","observation_id":"3087765e-665b-4789-80c0-4b10fa6ad09d","resolution":{"observed_at":"2026-05-13T01:19:32.642608Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2604.19657","last_updated":"2026-04-21T16:45:30Z","snapshot_observed_at":"2026-07-06T23:06:16.972438Z","submitted_at":"2026-04-21T16:45:30Z","title":"An AI Agent Execution Environment to Safeguard User Data","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-10T02:14:40.639143Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2604.19657"},"observation_digest":"sha256:dda2ca68e8df87f4afd896dc6d1532536c92d8bae5f4d6e4c2742c7e48f4b0e2","observation_id":"1c2be504-a7cd-435b-aa65-7e1cada043de","resolution":{"observed_at":"2026-05-13T01:19:32.642608Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2604.27245","last_updated":"2026-05-18T20:55:38Z","snapshot_observed_at":"2026-07-06T23:12:43.284564Z","submitted_at":"2026-04-29T22:33:36Z","title":"Addressing the Reality Gap: A Three-Tension Framework for Agentic AI Adoption","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-07T09:33:27.714427Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2604.27245"},"observation_digest":"sha256:26db666b1dc78d2fdd442d70644a40fc7f8c3cc823c4a2656d7c9fcacc725875","observation_id":"9c3fde8a-7c01-4147-8f95-ec5d9399ff71","resolution":{"observed_at":"2026-05-13T01:19:32.642608Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2604.27245","last_updated":"2026-05-18T20:55:38Z","snapshot_observed_at":"2026-07-06T23:12:43.284564Z","submitted_at":"2026-04-29T22:33:36Z","title":"Addressing the Reality Gap: A Three-Tension Framework for Agentic AI Adoption","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-20T23:52:17.061899Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2604.27245"},"observation_digest":"sha256:365ebcb6598b44b58f4c9e65e85f7a4480b8932fb447eb88f3b2362b05d2acea","observation_id":"39a0e033-0990-49a6-a3da-4e8240976b5d","resolution":{"observed_at":"2026-05-20T23:53:51.353667Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2605.01847","last_updated":"2026-05-13T18:25:03Z","snapshot_observed_at":"2026-08-02T20:45:09.206786Z","submitted_at":"2026-05-03T12:30:58Z","title":"NeuroState-Bench: A Human-Calibrated Benchmark for Commitment Integrity in LLM Agent Profiles","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T14:54:08.156511Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2605.01847"},"observation_digest":"sha256:c3ef6972011796a5e4c0897b13bbbad748440de25cd959d55a482fd7ca4fb0cc","observation_id":"c8618001-0809-4a68-9bfe-fae470de5136","resolution":{"observed_at":"2026-05-13T01:19:32.642608Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2605.01847","last_updated":"2026-05-13T18:25:03Z","snapshot_observed_at":"2026-08-02T20:45:09.206786Z","submitted_at":"2026-05-03T12:30:58Z","title":"NeuroState-Bench: A Human-Calibrated Benchmark for Commitment Integrity in LLM Agent Profiles","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T06:56:44.316029Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2605.01847"},"observation_digest":"sha256:7ef5c996d32823621309ce028b4873fde0eda67757e9b53de4485dbc08c4fb46","observation_id":"2be37d84-b3eb-4d9f-8621-3abdc73dea44","resolution":{"observed_at":"2026-05-15T06:59:49.257627Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2605.02729","last_updated":"2026-05-04T15:28:59Z","snapshot_observed_at":"2026-07-06T23:15:46.390406Z","submitted_at":"2026-05-04T15:28:59Z","title":"Augmenting Interface Usability Heuristics for Reliable Computer-Use Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T18:52:16.162336Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2605.02729"},"observation_digest":"sha256:9f9bcb8494fe94a2b8de810472d77dcd57991f65094581f6e98a3143034276fe","observation_id":"7ee0a034-8c83-48a4-ad06-a7a32eebe56d","resolution":{"observed_at":"2026-05-13T01:19:32.642608Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2605.05765","last_updated":"2026-05-21T06:55:40Z","snapshot_observed_at":"2026-08-07T03:54:21.317685Z","submitted_at":"2026-05-07T06:58:34Z","title":"X-OmniClaw Technical Report: A Unified Mobile Agent for Multimodal Understanding and Interaction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T14:53:52.019677Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2605.05765"},"observation_digest":"sha256:d1382bd1db2d65ea1ed3c278465e48b73ebad7e99d42f0722584c84b56c02f13","observation_id":"312c40f5-f571-4b74-84e4-f205ae9638df","resolution":{"observed_at":"2026-05-13T01:19:32.642608Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2605.05765","last_updated":"2026-05-21T06:55:40Z","snapshot_observed_at":"2026-08-07T03:54:21.317685Z","submitted_at":"2026-05-07T06:58:34Z","title":"X-OmniClaw Technical Report: A Unified Mobile Agent for Multimodal Understanding and Interaction","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T09:50:00.415616Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2605.05765"},"observation_digest":"sha256:17a82ce5296bf3f014d6ae4a0f513e7dc06e1de552466d25eff6cb606029c218","observation_id":"e090455c-764d-4059-bba2-527dd17e2491","resolution":{"observed_at":"2026-05-22T09:51:21.719603Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2605.06365","last_updated":"2026-05-07T14:39:37Z","snapshot_observed_at":"2026-08-06T13:04:30.081731Z","submitted_at":"2026-05-07T14:39:37Z","title":"From Agent Loops to Deterministic Graphs: Execution Lineage for Reproducible AI-Native Work","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-08T09:50:30.639962Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2605.06365"},"observation_digest":"sha256:57be06fa730b0d1b8784e54c21e0f7897e41197ec4ff0e1c70d609044b5a6f23","observation_id":"7fe53c18-0841-40f0-9444-da361312a449","resolution":{"observed_at":"2026-05-13T01:19:32.642608Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2605.08261","last_updated":"2026-05-07T22:43:43Z","snapshot_observed_at":"2026-08-05T15:10:26.147326Z","submitted_at":"2026-05-07T22:43:43Z","title":"Computer Use at the Edge of the Statistical Precipice","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-12T01:08:15.736001Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2605.08261"},"observation_digest":"sha256:2c9228ca56ee9ada2c187ef5feef73283c14683c4d390e9737c2a0f9a62264ce","observation_id":"cccaf9a3-0569-44c7-954e-1a197f8918cd","resolution":{"observed_at":"2026-05-13T01:19:32.642608Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2605.10448","last_updated":"2026-05-11T12:20:15Z","snapshot_observed_at":"2026-08-06T20:03:57.191605Z","submitted_at":"2026-05-11T12:20:15Z","title":"Can Agent Benchmarks Support Their Scores? Evidence-Supported Bounds for Interactive-Agent Evaluation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:55.592359Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2605.10448"},"observation_digest":"sha256:b8ca496ed70bbad65bd874788458c07cd5f2968fb3969b8a87186ec37acb8eb6","observation_id":"ec5fb971-a6ec-4eb9-9ade-2d989e18b270","resolution":{"observed_at":"2026-05-13T01:19:32.642608Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2605.10966","last_updated":"2026-05-08T10:57:19Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-08T10:57:19Z","title":"MMTB: Evaluating Terminal Agents on Multimedia-File Tasks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T01:03:22.390574Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2605.10966"},"observation_digest":"sha256:b7c0beba6d745092d1138ce2f3874da717d19cda43aa5ecaa6c014c4e7a98608","observation_id":"91415c43-8a4a-4889-a950-cf58d03451d3","resolution":{"observed_at":"2026-05-13T01:19:32.642608Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2605.12673","last_updated":"2026-05-12T19:22:45Z","snapshot_observed_at":"2026-08-02T02:31:32.394072Z","submitted_at":"2026-05-12T19:22:45Z","title":"Do Androids Dream of Breaking the Game? Systematically Auditing AI Agent Benchmarks with BenchJack","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-14T20:31:50.043920Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2605.12673"},"observation_digest":"sha256:277a8d169bf576e4c88853ee6c21dff1cfdcc36089abd73436dd1cd9d154f243","observation_id":"129bda9f-d70a-4730-97fc-d03263e9b001","resolution":{"observed_at":"2026-05-14T20:32:56.835280Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2605.13631","last_updated":"2026-06-10T08:07:41Z","snapshot_observed_at":"2026-08-06T00:45:09.267894Z","submitted_at":"2026-05-13T14:58:24Z","title":"ProjGuard: Safety Monitoring for Computer-Use Agents via Low-Dimensional Projections","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T21:12:50.686474Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2605.13631"},"observation_digest":"sha256:4579026d28df1579ef07c4745c8f23b53612a0ae0511a74fdf0a3d814c538fd2","observation_id":"628d2910-eb0e-44f0-a840-a01d93968117","resolution":{"observed_at":"2026-06-30T21:15:04.178212Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2605.14102","last_updated":"2026-05-18T23:56:06Z","snapshot_observed_at":"2026-07-06T23:25:34.835136Z","submitted_at":"2026-05-13T20:40:37Z","title":"ChromaFlow: A Negative Ablation Study of Orchestration Overhead in Tool-Augmented Agent Evaluation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T05:17:37.850154Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2605.14102"},"observation_digest":"sha256:49ab322f371eed5ee195fd008a7475262d40bbdf352be852d9372274c1e20f2a","observation_id":"bb2eabd7-0d48-4ba9-8e92-d94058ae0a1b","resolution":{"observed_at":"2026-05-15T05:19:46.267389Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2605.14102","last_updated":"2026-05-18T23:56:06Z","snapshot_observed_at":"2026-07-06T23:25:34.835136Z","submitted_at":"2026-05-13T20:40:37Z","title":"ChromaFlow: A Negative Ablation Study of Orchestration Overhead in Tool-Augmented Agent Evaluation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T20:32:10.141343Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2605.14102"},"observation_digest":"sha256:5888c76b840b80d6278cbac65b20a030c3b2081cf06cf3eb05008d65c0058c0c","observation_id":"17efd460-2324-4a42-8f49-25ed16f9ddc7","resolution":{"observed_at":"2026-05-20T20:33:43.129581Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2605.16679","last_updated":"2026-05-19T05:51:20Z","snapshot_observed_at":"2026-08-02T09:51:22.510077Z","submitted_at":"2026-05-15T22:34:31Z","title":"CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows?","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-20T17:45:02.896703Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2605.16679"},"observation_digest":"sha256:c5674161b0c3c0cb5ba6beac6013dc9fb7321c2a016b2fff9c62c37c6d52eb44","observation_id":"a9b79432-6d19-41d0-9b3b-99d0ea5a0813","resolution":{"observed_at":"2026-05-20T17:48:48.826044Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2605.17320","last_updated":"2026-05-17T08:24:01Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:24:01Z","title":"TClone: Low-Latency Forking of Live GUI Environments for Computer-Use Agents","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-19T22:55:28.637039Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2605.17320"},"observation_digest":"sha256:e49af75fe57c85392280884143385cb9c4dad74f51b2730d598b0d56dcddf1f6","observation_id":"485adf21-7650-4e82-b235-0a94a4437746","resolution":{"observed_at":"2026-05-19T22:57:50.193076Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2605.17656","last_updated":"2026-05-17T21:14:32Z","snapshot_observed_at":"2026-08-02T16:00:46.597782Z","submitted_at":"2026-05-17T21:14:32Z","title":"MUIAnno: An Expert-Annotated Dataset and Evaluation Benchmark for Mobile UI Understanding","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-19T22:08:27.511727Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2605.17656"},"observation_digest":"sha256:036b66674cc6c8ccce6f78b8522e19222e22d581dae969081fff5e325ba1acd2","observation_id":"92dbda9f-7b41-44f9-9101-2dd726c6d696","resolution":{"observed_at":"2026-05-19T22:12:50.568653Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2605.19099","last_updated":"2026-05-18T20:37:14Z","snapshot_observed_at":"2026-07-31T05:54:44.970755Z","submitted_at":"2026-05-18T20:37:14Z","title":"DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-20T10:16:38.920528Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2605.19099"},"observation_digest":"sha256:46f5d4e1848b80bdee00fa960793eafabc9397d81eea6c6a306e861ae6d55f68","observation_id":"c4b78e58-b813-4555-bd31-05a4205fa2c4","resolution":{"observed_at":"2026-05-20T10:18:11.662722Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2605.22643","last_updated":"2026-05-22T14:53:30Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T15:50:18Z","title":"Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-22T05:50:28.114140Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2605.22643"},"observation_digest":"sha256:f1843913afbcd3c33b63f672e4d30da0c170a49a99e8ec09abcb848b4b303ead","observation_id":"f04903dd-771d-4f29-b4d4-5a70e275a4c1","resolution":{"observed_at":"2026-05-22T05:51:08.002848Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2605.22643","last_updated":"2026-05-22T14:53:30Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T15:50:18Z","title":"Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-25T06:05:27.736494Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2605.22643"},"observation_digest":"sha256:14ffb473dcfaa93f74b5f7cda6e31d81d15b28f7ba4265ff3c322a7a17b3e89f","observation_id":"b4444d1a-6104-4618-8ef6-77bc024d2374","resolution":{"observed_at":"2026-05-25T06:06:42.834544Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2605.25160","last_updated":"2026-06-18T02:24:07Z","snapshot_observed_at":"2026-08-03T08:02:05.766526Z","submitted_at":"2026-05-24T16:33:14Z","title":"ScaleWoB: Guiding GUI Agents with Coding Agents via Large-Scale Environmental Synthesis","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T10:57:59.013811Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2605.25160"},"observation_digest":"sha256:e39ca00100b29f3d544e3b017fa1ed31c08a789d5796edab39d0a0285f63ed9c","observation_id":"e875bef5-035f-4dc6-9d21-f8bc8f663f7a","resolution":{"observed_at":"2026-06-30T11:04:37.692134Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2605.25343","last_updated":"2026-05-25T01:57:43Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T01:57:43Z","title":"Toward Native Multimodal Modeling: A Roadmap","version":1},"reference_index":133,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:38.610609Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2605.25343"},"observation_digest":"sha256:e9485d4eaa30932dd5f4a01856e7e4d33ba32b2500944dba89d0ef7a5d05bb6c","observation_id":"ba4257a2-04d5-4132-b839-2a476e23b5a1","resolution":{"observed_at":"2026-06-29T23:04:01.790934Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2605.26144","last_updated":"2026-06-22T18:12:46Z","snapshot_observed_at":"2026-07-31T13:06:22.821298Z","submitted_at":"2026-05-22T20:29:12Z","title":"VISTA: An End-to-End Benchmark for Visual Spec-to-Web-App Coding Agents","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T14:44:53.335178Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2605.26144"},"observation_digest":"sha256:bd7b21b951f7eff13f0d320b372ba8ac7aad4f0d6ed7a206658c6941ceff5f6b","observation_id":"0b9f29b5-77bb-4699-ae9e-568309c91f0d","resolution":{"observed_at":"2026-06-30T14:54:45.652180Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2605.26329","last_updated":"2026-05-25T21:07:02Z","snapshot_observed_at":"2026-08-02T00:37:42.834250Z","submitted_at":"2026-05-25T21:07:02Z","title":"JobBench: Aligning Agent Work With Human Will","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T21:24:29.232709Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2605.26329"},"observation_digest":"sha256:50efc73487c56f0cc157ccd59233504a4a2e7d7c6670d57657a037ed016efc7b","observation_id":"b538d906-a148-4471-a20c-adb3ef165141","resolution":{"observed_at":"2026-06-29T21:33:59.457856Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2605.28158","last_updated":"2026-05-27T08:41:30Z","snapshot_observed_at":"2026-07-06T23:37:45.223562Z","submitted_at":"2026-05-27T08:41:30Z","title":"OR-Space: A Full-Lifecycle Workspace Benchmark for Industrial Optimization Agents","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T12:52:20.911788Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2605.28158"},"observation_digest":"sha256:58c7f6eccc837022738e3f9eccb42c9299d930e9e39546dc6ef633b21503604b","observation_id":"b7054e13-65f4-4ff1-9991-a6e79549a425","resolution":{"observed_at":"2026-06-29T12:53:26.367017Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2605.28876","last_updated":"2026-05-26T06:34:47Z","snapshot_observed_at":"2026-08-02T02:21:39.998458Z","submitted_at":"2026-05-26T06:34:47Z","title":"LogDx-CI: Benchmarking Log Reduction Tools for LLM Root-Cause Diagnosis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T16:09:27.852716Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2605.28876"},"observation_digest":"sha256:395371b9e7c69547a00339c16d047063e0896b92872ffdfa55e038975f5a709f","observation_id":"99d73b7a-c0c8-4b2f-9ff9-874eff3809cc","resolution":{"observed_at":"2026-06-29T16:13:36.055090Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2605.29115","last_updated":"2026-05-27T21:23:00Z","snapshot_observed_at":"2026-08-01T21:39:08.620495Z","submitted_at":"2026-05-27T21:23:00Z","title":"unix-ctf: Procedural Environments for Unix-Competence Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T11:19:38.959705Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2605.29115"},"observation_digest":"sha256:e6adac80cc7b95d07770d4771687f82cef69bda8356aa74e94600db96deb58d6","observation_id":"431c9706-c82f-443a-a499-cd75dff39cc1","resolution":{"observed_at":"2026-06-29T11:23:20.863611Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2606.01961","last_updated":"2026-06-03T05:43:27Z","snapshot_observed_at":"2026-08-07T15:01:13.401479Z","submitted_at":"2026-06-01T09:22:55Z","title":"AutoMedBench: Towards Medical AutoResearch with Agentic AI Models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-28T14:38:40.017263Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2606.01961"},"observation_digest":"sha256:bb4707855235dbba20b6970fb883c09d1f88b4f84a05c73ce39c183a67c4e005","observation_id":"d25a1708-869f-4877-94de-43d5f06fc7b7","resolution":{"observed_at":"2026-07-01T23:06:21.120068Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2606.05233","last_updated":"2026-06-03T01:21:59Z","snapshot_observed_at":"2026-08-03T04:28:49.622809Z","submitted_at":"2026-06-03T01:21:59Z","title":"Domain-Conditioned Safety in Frontier Computer-Using Agents: A 793-Episode Browser Benchmark, a Coding-Domain Cross-Reference, and a Reproducibility Audit of Recent Red-Teaming","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T06:22:03.848058Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2606.05233"},"observation_digest":"sha256:d21d1fb1e91994b2f4fb91288ee48552542065228291a6a3c15ac796a7a74376","observation_id":"204f3772-d73c-4ebd-819c-6a34d06aa610","resolution":{"observed_at":"2026-07-02T08:06:48.247592Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2606.05661","last_updated":"2026-06-04T03:43:28Z","snapshot_observed_at":"2026-07-06T23:45:37.713710Z","submitted_at":"2026-06-04T03:43:28Z","title":"Continual Learning Bench: Evaluating Frontier AI Systems in Real-World Stateful Environments","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T01:45:28.693098Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2606.05661"},"observation_digest":"sha256:48c18f4c45fa596c6371d80c2b9b2d8e3b93551eec57bf489337356deea12695","observation_id":"5bfbde66-5caf-4e99-b9d3-61db7a082ccc","resolution":{"observed_at":"2026-07-02T12:56:56.823942Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2606.06322","last_updated":"2026-06-04T15:57:29Z","snapshot_observed_at":"2026-08-02T19:13:51.313136Z","submitted_at":"2026-06-04T15:57:29Z","title":"DragOn: A Benchmark and Dataset for Drag-Based GUI Interactions","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-28T01:37:45.812577Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2606.06322"},"observation_digest":"sha256:5ee1655b0a93b2ae03df7126304612717d040abdc3848ec238623f81968dd24a","observation_id":"59e18fa3-dd0c-40fd-becf-acb2b4d70162","resolution":{"observed_at":"2026-06-28T01:41:29.382021Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2606.06708","last_updated":"2026-08-04T18:57:23Z","snapshot_observed_at":"2026-08-07T20:12:56.293055Z","submitted_at":"2026-06-04T20:48:37Z","title":"Signal-Driven Observation for Long-Horizon Web Agents","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-28T01:25:11.149977Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2606.06708"},"observation_digest":"sha256:87895d6f37e9d8283bb00ea79f62c3e930ee8794004d7a84497809991b8b484d","observation_id":"986ea443-d739-45f7-a4bd-2a2424c8ba3d","resolution":{"observed_at":"2026-06-28T01:31:29.182702Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2606.08200","last_updated":"2026-06-06T14:37:33Z","snapshot_observed_at":"2026-07-06T23:47:43.942733Z","submitted_at":"2026-06-06T14:37:33Z","title":"Online Agent-as-a-Judge: Situation-Generating Evaluation for Interactive Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T19:45:10.664592Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2606.08200"},"observation_digest":"sha256:c41a1b7f68bc57089c2451e8d7162d1ec448ff103ec0674afeda2159a93b6a79","observation_id":"f471f672-402a-4c1f-9f79-c3c8f5afc7ce","resolution":{"observed_at":"2026-06-27T19:51:12.581395Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2606.10064","last_updated":"2026-06-08T18:39:15Z","snapshot_observed_at":"2026-08-07T06:31:28.946293Z","submitted_at":"2026-06-08T18:39:15Z","title":"Bittensor Agent Arenas as a Trajectory Primitive: Distilling a Shopping Agent from ShoppingBench Subnet Traces","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T17:07:39.645843Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2606.10064"},"observation_digest":"sha256:c096ca1e111cdb77f801bbcd9983919c81dbdb0ac021ac4c309bd9970a133363","observation_id":"676eedc4-f966-46ac-8a5a-bf48f9198938","resolution":{"observed_at":"2026-07-03T00:37:29.834859Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2606.11702","last_updated":"2026-06-10T06:26:52Z","snapshot_observed_at":"2026-08-06T19:37:03.477588Z","submitted_at":"2026-06-10T06:26:52Z","title":"MedCTA: A Benchmark for Clinical Tool Agents","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-27T10:32:01.387453Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2606.11702"},"observation_digest":"sha256:298a32c8039cb7294582bb395b1b446a34122e27aaf7209a95d9e8bc97fa71c4","observation_id":"9034f7da-dcdf-4ee1-8b55-ce51053694db","resolution":{"observed_at":"2026-07-03T09:07:47.973992Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2606.14517","last_updated":"2026-06-16T09:28:39Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:49:00Z","title":"From Shield to Target: Denial-of-Service Attacks on LLM-Based Agent Guardrails","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T04:42:05.886984Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2606.14517"},"observation_digest":"sha256:6220b0a72f961ee335c0f23d099f87e3cc545ffe7df44346a600cf5c0efec490","observation_id":"ecdfb51e-749b-4c1c-8f12-830a4a1967d5","resolution":{"observed_at":"2026-07-03T16:58:43.570651Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2606.15932","last_updated":"2026-06-16T15:28:03Z","snapshot_observed_at":"2026-07-06T23:52:37.922109Z","submitted_at":"2026-06-14T17:21:43Z","title":"Beyond NL2Code: A Structured Survey of Multimodal Code Intelligence","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-06-27T03:57:19.028507Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2606.15932"},"observation_digest":"sha256:471d0b0c76c51e84f6c33cd1efb3e1e78a97b04f746b46fd25690445d1ecd03d","observation_id":"b0e318c6-2350-4f65-9b7f-ef12c8db6307","resolution":{"observed_at":"2026-07-03T17:38:44.116785Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2606.17321","last_updated":"2026-06-15T22:04:11Z","snapshot_observed_at":"2026-07-06T23:52:57.359941Z","submitted_at":"2026-06-15T22:04:11Z","title":"ProCUA-SFT Technical Report","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T03:18:04.149281Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2606.17321"},"observation_digest":"sha256:e670471b1a6292b3c1903c432f7c4af4bf19a9606ca0aeba6fec4cd8773b0bbf","observation_id":"4c6f4af5-c226-4b7d-8677-afe15c476945","resolution":{"observed_at":"2026-07-03T18:08:46.692464Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2606.17454","last_updated":"2026-06-17T04:51:06Z","snapshot_observed_at":"2026-08-02T05:33:09.695431Z","submitted_at":"2026-06-16T03:17:03Z","title":"Dissecting model behavior through agent trajectories","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-27T01:27:39.812496Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2606.17454"},"observation_digest":"sha256:e738ecc7d88dbd64a2642727f2d36e3a2e1ec12fa777c58deb2a2496c55525e6","observation_id":"20c23fbe-6d3a-4871-b31f-22cbee475275","resolution":{"observed_at":"2026-07-03T20:18:56.935465Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-07T07:19:16.884215Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:e8d2e147b064771dd0e7a3b23efbb874eae1827372953a792acdd03df2c95288","observation_id":"9fba41a5-172a-477f-9198-c5c2054a91e0","resolution":{"observed_at":"2026-07-03T20:18:57.201947Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2606.19409","last_updated":"2026-06-17T15:19:19Z","snapshot_observed_at":"2026-08-03T01:26:10.680902Z","submitted_at":"2026-06-17T15:19:19Z","title":"OpenRath: Session-Centered Runtime State for Agent Systems","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-26T20:18:48.243426Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2606.19409"},"observation_digest":"sha256:f48516f7c95f822a03995159848c2c3f4638c608fc241e7975604251045c39e3","observation_id":"b24081f8-6507-4cb3-9fc4-6f529091bc0f","resolution":{"observed_at":"2026-07-04T01:29:23.057631Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2606.19613","last_updated":"2026-06-17T21:36:09Z","snapshot_observed_at":"2026-08-07T13:16:30.354063Z","submitted_at":"2026-06-17T21:36:09Z","title":"StaminaBench: Stress-Testing Coding Agents over 100 Interaction Turns","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-26T19:47:59.090249Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2606.19613"},"observation_digest":"sha256:b01aa347562158674d2adda9cb4503aa3c5d53d21d55178253d14a682efc34b1","observation_id":"634fb884-4b43-4c52-a1ac-aa63bb85ae65","resolution":{"observed_at":"2026-07-04T02:19:23.924611Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2606.20717","last_updated":"2026-06-16T15:31:33Z","snapshot_observed_at":"2026-08-03T03:41:11.931921Z","submitted_at":"2026-06-16T15:31:33Z","title":"MIRAGE: Stealthy Visual Prompt Injection for Vulnerability Detection in Web Agents","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-27T00:54:00.944706Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2606.20717"},"observation_digest":"sha256:ae5e5f65880b2f8b48bd0ea1c844821b23fa7b386a7c22a9adeaab322ef3e780","observation_id":"a61e9752-141a-4f5f-9513-355acb2bed54","resolution":{"observed_at":"2026-07-03T21:08:58.347763Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2606.23049","last_updated":"2026-06-24T02:20:35Z","snapshot_observed_at":"2026-07-06T23:57:53.101659Z","submitted_at":"2026-06-22T08:57:54Z","title":"PhoneBuddy: Training Open Models for Agentic Phone Use","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-26T08:15:49.428124Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2606.23049"},"observation_digest":"sha256:8dc768afa78c1eff767757a837a6b1c8caf89639db8e925f6604eb0873126bcf","observation_id":"b8cde36b-ff87-4f3a-9bd5-2d4efbadff3e","resolution":{"observed_at":"2026-07-04T10:59:46.504700Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-07-12T11:37:35.542449Z","title":"Keyulu Xu, Weihua Hu, Jure Leskovec, and Ste- fanie Jegelka","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.27806","last_updated":"2026-07-05T07:44:24Z","snapshot_observed_at":"2026-08-07T08:14:46.019506Z","submitted_at":"2026-06-26T07:45:15Z","title":"Agent vs. Parametric World Models: Hybrid Planning for Reliable Language Agents","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T11:37:35.542449Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2606.27806"},"observation_digest":"sha256:8fd0f37f4fc6174ff4b85db809e961f53fa2f975e1ac86b524649b4674c5eaf3","observation_id":"ed6c4d3c-cf0f-4a99-8330-cd5ab95518ac","resolution":{"observed_at":"2026-07-12T11:37:35.542449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2606.29472","last_updated":"2026-06-28T15:59:31Z","snapshot_observed_at":"2026-08-01T16:45:40.105247Z","submitted_at":"2026-06-28T15:59:31Z","title":"Agent-Computer Observation Interfaces Enable Dynamic Computer Use","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T06:59:20.295818Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2606.29472"},"observation_digest":"sha256:30f22b5e34640a2ecb4aaacac296a655725340fb5bebc34403bbfefc8e167370","observation_id":"90aa53f0-1a45-4f9c-988b-3726014708b1","resolution":{"observed_at":"2026-06-30T07:04:21.271037Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2606.29537","last_updated":"2026-07-13T10:30:17Z","snapshot_observed_at":"2026-07-17T23:18:06.822637Z","submitted_at":"2026-06-28T17:59:17Z","title":"OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-06-30T07:10:38.909339Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2606.29537"},"observation_digest":"sha256:894b337b1d7175f24d440b40c1d1bf98ca055cf9462cf90cfccd238d30fe0004","observation_id":"bc1ea22f-ce92-4b19-bd9c-78e4d25964e6","resolution":{"observed_at":"2026-06-30T07:14:21.100795Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-07-15T10:24:53.345620Z","title":"OSWorld: Benchmarking multimodal agents for open-ended tasks in real computer environments.ArXiv preprint, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29537","last_updated":"2026-07-13T10:30:17Z","snapshot_observed_at":"2026-07-17T23:18:06.822637Z","submitted_at":"2026-06-28T17:59:17Z","title":"OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-07-15T10:24:53.345620Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2606.29537"},"observation_digest":"sha256:bddfd6676f4f27f014b756b93d309414a605e9ad650d9a56b7638288648ced9e","observation_id":"958cd20e-c09a-4896-b797-a35e52443aa0","resolution":{"observed_at":"2026-07-15T10:24:53.345620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2404.07972/citation-record","integrity":"/paper/2404.07972/integrity","json":"/paper/2404.07972/citation-record.json","paper":"/paper/2404.07972"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ACT-1: Transformer for Actions","venue":null,"work_id":"48054042-00c9-4598-b4ce-3525cfd4707c","year":2022},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:056dcd40f183a283252dd2f8beac6d77f58a1978e98d9f85ed6ad3a635bfe0e1","observation_id":"e87cf1fd-a8e3-4ed9-88a3-6f9f149cb93f","resolution":{"observed_at":"2026-05-13T01:19:32.622324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing the next generation of claude","venue":null,"work_id":"4a360390-80c0-437c-a060-3cf4c1a0bc77","year":2023},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:d0b7e94cf17f8bbf5879ce06d5872f82bc44ea40c932f7f6ed9a0cc86731eb7d","observation_id":"24b03bd5-ccdd-4702-a2b7-7efb120eb987","resolution":{"observed_at":"2026-05-13T01:19:32.615361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":"6353267b-ebb8-46ab-b396-ed506c39369a","year":2024},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:c0cf29ff1de7682dac1821871fed72dc105a651c28dae0c90a8cbb2dc5baae32","observation_id":"3c6ab962-88a4-44e4-be8a-5adeeefcee2a","resolution":{"observed_at":"2026-05-13T01:19:32.612990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04615","last_updated":"2024-07-04T07:08:15Z","snapshot_observed_at":"2026-08-06T14:40:03.846075Z","submitted_at":"2024-02-07T06:42:33Z","title":"ScreenAI: A Vision-Language Model for UI and Infographics Understanding","version":3},"cited_work":{"arxiv_id":"2402.04615","doi":"10.48550/arxiv.2402.04615","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04615","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ScreenAI: A Vision-Language Model for UI and Infographics Understanding , year =","venue":"arXiv (Cornell University)","work_id":"8932b44f-ca2e-43e2-a3b2-a6045708e220","year":2024},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2402.04615","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:a6c018a1750ff7e97ffa14d487c1968deb59ca8e7149ca339f9696dffdcc1f5a","observation_id":"efc94861-acd1-47a8-ac82-95857e7e65c7","resolution":{"observed_at":"2026-05-13T01:19:32.469196Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:12.414609+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:12.414609+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":"2309.16609","doi":"10.48550/arxiv.2309.16609","metadata_source":"pith","pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen Technical Report","venue":"cs.CL","work_id":"bb1fd52f-6b2f-437c-9516-37bdf6eb9be8","year":2023},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:add3049c9212da85a2b2caf8f0f4c47cd663a23bcd66c6bb360c9436a0602cb3","observation_id":"d3d84067-01f8-40ea-a830-988413575bc7","resolution":{"observed_at":"2026-05-13T01:19:32.442790Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":"2212.06817","doi":"10.48550/arxiv.2212.06817","metadata_source":"pith","pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","venue":"cs.RO","work_id":"e11bda85-8531-46bc-a07f-d0ade3643ab1","year":2022},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:de053879e2ac76729b471b67a60eb89e884079aff5a005b38256b302c144e4f5","observation_id":"f0b874fe-07af-41dd-96cf-1ece28c77511","resolution":{"observed_at":"2026-05-13T01:19:32.446816Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:20164422ec12fb845ba94d1af3f7a2ef1a780aea9912f08503e96e84bb687d9b","observation_id":"37a39ef4-f617-4a6d-abd2-6c000a0eaf42","resolution":{"observed_at":"2026-05-13T01:19:32.450810Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10935","last_updated":"2024-02-23T04:36:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-17T08:10:35Z","title":"SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents","version":2},"cited_work":{"arxiv_id":"2401.10935","doi":"10.48550/arxiv.2401.10935","metadata_source":"pith","pith_arxiv_id":"2401.10935","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents","venue":"cs.HC","work_id":"8fe50425-9d6d-4080-bd43-51b3d0d0e5f6","year":2024},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2401.10935","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:db6c7f069c97901929aeaedcf09c1d65f86e1d27d7ed30aa354570805ca0df9a","observation_id":"845927e9-9ff1-4b9b-b3fa-45c2748c6dd9","resolution":{"observed_at":"2026-05-17T10:09:46.778093Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06070","last_updated":"2023-12-09T05:57:46Z","snapshot_observed_at":"2026-07-06T15:40:50.807376Z","submitted_at":"2023-06-09T17:44:31Z","title":"Mind2Web: Towards a Generalist Agent for the Web","version":3},"cited_work":{"arxiv_id":"2306.06070","doi":"10.48550/arxiv.2306.06070","metadata_source":"pith","pith_arxiv_id":"2306.06070","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mind2Web: Towards a Generalist Agent for the Web","venue":"cs.CL","work_id":"e26f5a00-c007-439d-83f6-7900f5687b6b","year":2023},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2306.06070","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:9f15276dfefd3b3d68ce0cc9267252c7bbab01a4427a3c0d456578cae103cda1","observation_id":"47fc6f52-90de-4566-8eef-4db63cee2c0e","resolution":{"observed_at":"2026-05-15T20:05:16.335224Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:29.437492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:29.437492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07718","last_updated":"2024-07-23T06:19:28Z","snapshot_observed_at":"2026-08-02T12:09:24.340284Z","submitted_at":"2024-03-12T14:58:45Z","title":"WorkArena: How Capable Are Web Agents at Solving Common Knowledge Work Tasks?","version":5},"cited_work":{"arxiv_id":"2403.07718","doi":"10.48550/arxiv.2403.07718","metadata_source":"pith","pith_arxiv_id":"2403.07718","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WorkArena: How Capable Are Web Agents at Solving Common Knowledge Work Tasks?","venue":"cs.LG","work_id":"5ac27d9e-4522-46f8-985e-0e4f73130803","year":2024},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2403.07718","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:dab0e7d06b2412386679c7b16a20a081617f0ebbb2d20927cc7f66b71261d5a6","observation_id":"5a5208d7-d8f2-404f-adeb-0f7d94e205c8","resolution":{"observed_at":"2026-05-15T02:48:05.307585Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c6632699-8798-4e6a-96e5-22676b0df0ca","year":2023},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:412e1bf85e5ab250cdd22f6e6a7a1ab7fd120fad89c11262e1a184416070cecb","observation_id":"2b30dd0c-3f10-46f4-a9bc-d16263bd24b1","resolution":{"observed_at":"2026-05-13T01:19:32.607565Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11854","last_updated":"2024-02-25T16:21:00Z","snapshot_observed_at":"2026-07-06T15:29:50.743434Z","submitted_at":"2023-05-19T17:44:34Z","title":"Multimodal Web Navigation with Instruction-Finetuned Foundation Models","version":4},"cited_work":{"arxiv_id":"2305.11854","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.11854","snapshot_observed_at":"2026-07-04T01:59:24.677192Z","title":"Mul- timodal web navigation with instruction-finetuned foundation models","venue":null,"work_id":"0f8b8630-9215-4cb8-9b7d-e58e6b1f7bbb","year":2023},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2305.11854","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:c6ae19e59592b240b0719c8f98fd7472d941d0e30b0e947603a65a5b70262cb8","observation_id":"26bbebfe-935e-4e7b-a189-b2f04b35bbe8","resolution":{"observed_at":"2026-05-13T01:19:32.525521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13108","last_updated":"2024-01-01T14:26:39Z","snapshot_observed_at":"2026-07-06T17:06:00.378648Z","submitted_at":"2023-12-20T15:28:38Z","title":"ASSISTGUI: Task-Oriented Desktop Graphical User Interface Automation","version":2},"cited_work":{"arxiv_id":"2312.13108","doi":"10.48550/arxiv.2312.13108","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.13108","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Assistgui: Task-oriented desktop graphical user interface automation","venue":"arXiv (Cornell University)","work_id":"451f25b4-9ee3-48d1-9c22-a5942c8a1121","year":2023},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2312.13108","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:2089ad89f328f5f615cb529ccc8583ad2b51f84ca305d159c8a7e3416a9c3a2e","observation_id":"c3821a82-c34f-4022-a157-b50f5a7fa60e","resolution":{"observed_at":"2026-05-13T01:19:32.528636Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01767","last_updated":"2023-11-07T10:13:34Z","snapshot_observed_at":"2026-07-06T16:42:36.107644Z","submitted_at":"2023-11-03T08:06:35Z","title":"PPTC Benchmark: Evaluating Large Language Models for PowerPoint Task Completion","version":2},"cited_work":{"arxiv_id":"2311.01767","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.01767","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2311.01767 , year=","venue":null,"work_id":"0f624456-1335-43d2-a94e-8e854b11b317","year":2023},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2311.01767","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:6c098eaee84fcdde55c9f1da9c41b7ae883c19de49847cca1d9c5ce81d705dd2","observation_id":"c4eac973-4ba2-4188-a9fb-89b51cebdd30","resolution":{"observed_at":"2026-05-13T01:19:32.532136Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12856","last_updated":"2024-02-25T16:17:43Z","snapshot_observed_at":"2026-07-06T15:57:53.178833Z","submitted_at":"2023-07-24T14:56:30Z","title":"A Real-World WebAgent with Planning, Long Context Understanding, and Program Synthesis","version":4},"cited_work":{"arxiv_id":"2307.12856","doi":"10.48550/arxiv.2307.12856","metadata_source":"pith","pith_arxiv_id":"2307.12856","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Real-World WebAgent with Planning, Long Context Understanding, and Program Synthesis","venue":"cs.LG","work_id":"0915d1fc-bc46-4128-871e-f9233dca44b6","year":2023},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2307.12856","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:28e6351ebb3661fcd13282e892f5216fa719b0ccbc943d046d81a83690facabb","observation_id":"3a4cc4f2-a11f-439c-ac7a-26463c39fa5f","resolution":{"observed_at":"2026-05-17T04:37:34.727630Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13919","last_updated":"2024-06-06T18:37:34Z","snapshot_observed_at":"2026-08-07T11:03:34.753698Z","submitted_at":"2024-01-25T03:33:18Z","title":"WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models","version":4},"cited_work":{"arxiv_id":"2401.13919","doi":"10.48550/arxiv.2401.13919","metadata_source":"pith","pith_arxiv_id":"2401.13919","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models","venue":"cs.CL","work_id":"12c1d840-af20-4a4e-8750-6b9c6266638f","year":2024},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2401.13919","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:1dcaeceabc1c6292a7a3e3bd2de5381b0ce32541fc5af3c742a8f5021e393ea5","observation_id":"640615f0-63c6-4dab-8214-f12642c0eb00","resolution":{"observed_at":"2026-05-15T22:43:35.479641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:0ef47e18644736b4efa36868751c814942d02c7dec0a6521c39e0b1f97520f69","observation_id":"639bd103-164a-48a4-bd0d-82cbf0daa853","resolution":{"observed_at":"2026-05-13T01:19:32.465423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A data-driven approach for learning to control computers","venue":null,"work_id":"772c038f-57f7-4e27-a2b2-abf4ae0ea9a7","year":2022},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:f98fbd88f7f92c71a61fc223709473b1540dfa7dfda18485ee203f556f06d5b6","observation_id":"83df3bdd-e0a0-4eec-afb2-4a140ab0c40c","resolution":{"observed_at":"2026-05-13T01:19:32.624649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-07T13:04:50.040909Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":"2401.04088","doi":"10.48550/arxiv.2401.04088","metadata_source":"pith","pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixtral of Experts","venue":"cs.LG","work_id":"0de8c352-9daa-4e1e-8c7b-3d0dec69f369","year":2024},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:25a0a2ad3a56269590d5124e3022676429826e0926233f4d6d8377c3f6edbc7d","observation_id":"0b1d778c-6d22-4137-8a89-1f50763bdee9","resolution":{"observed_at":"2026-05-13T01:19:32.541679Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:39.110013+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:39.110013+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":"2310.06770","doi":"10.1145/512927.512945","metadata_source":"pith","pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","venue":"cs.CL","work_id":"d0effe15-a689-441a-8e3f-ea35f1c4e4b1","year":2023},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:3af5bb791d103ff0062c0167393275217c70e6306f7f0d0c426ecbffd6b9f709","observation_id":"23455256-bf66-4abe-8213-a40fefe12952","resolution":{"observed_at":"2026-05-13T01:19:32.545200Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17553","last_updated":"2024-07-21T23:16:13Z","snapshot_observed_at":"2026-07-06T17:36:16.016176Z","submitted_at":"2024-02-27T14:47:53Z","title":"OmniACT: A Dataset and Benchmark for Enabling Multimodal Generalist Autonomous Agents for Desktop and Web","version":3},"cited_work":{"arxiv_id":"2402.17553","doi":"10.48550/arxiv.2402.17553","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.17553","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omniact: A dataset and benchmark for enabling multimodal generalist autonomous agents for desktop and web","venue":"arXiv (Cornell University)","work_id":"ea5b5f34-17a8-436c-a2c4-db66a519d883","year":2024},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2402.17553","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:218874393625d68a50a913d822b76d35952f5f2709ef11e65ca933ae75c2becf","observation_id":"e815a620-7508-4d43-9732-deac89b7ccc0","resolution":{"observed_at":"2026-05-13T01:19:32.548729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13649","last_updated":"2024-06-06T02:01:09Z","snapshot_observed_at":"2026-08-05T16:01:54.847394Z","submitted_at":"2024-01-24T18:35:21Z","title":"VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks","version":2},"cited_work":{"arxiv_id":"2401.13649","doi":"10.48550/arxiv.2401.13649","metadata_source":"pith","pith_arxiv_id":"2401.13649","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks","venue":"cs.LG","work_id":"37f08c56-1b7d-4d9e-baf9-7c2ebb7e6acd","year":2024},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2401.13649","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:ee5fda9dad6c53acce070abbcaa38f19e30729a531b311d43ebb6c1fca885b75","observation_id":"92394b64-b147-4b23-aa4e-831a1940f237","resolution":{"observed_at":"2026-05-17T15:20:36.653799Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pix2struct: Screenshot parsing as pretraining for visual language understanding","venue":null,"work_id":"1c2e3845-b01d-41f8-875b-25dab1c9776d","year":2023},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:f12dbdd94e4cc2b25bc8de24d388e8106fdfc967839c12811da3f18715c08c09","observation_id":"ed91c05c-c1a2-4a65-8ef0-70d490ed9293","resolution":{"observed_at":"2026-05-13T01:19:32.635957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08604","last_updated":"2024-12-14T09:45:51Z","snapshot_observed_at":"2026-08-06T13:32:36.381010Z","submitted_at":"2024-03-13T15:13:44Z","title":"Prompting Large Language Models to Tackle the Full Software Development Lifecycle: A Case Study","version":3},"cited_work":{"arxiv_id":"2403.08604","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.08604","snapshot_observed_at":"2026-07-04T09:39:46.934646Z","title":"DevBench: A comprehensive benchmark for software development.arXiv preprint arXiv:2403.08604, 3","venue":null,"work_id":"a4eb17af-0573-470e-b2b6-600c3e211106","year":2024},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2403.08604","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:63951c861b312fc4b78f73ae174b08d8162d47d8f65d5f6d94623e3314d2214a","observation_id":"12a5dd74-81c7-41d0-b5c7-26816fe11cc2","resolution":{"observed_at":"2026-05-13T01:19:32.554838Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19308","last_updated":"2023-10-30T06:36:24Z","snapshot_observed_at":"2026-07-06T15:35:33.952097Z","submitted_at":"2023-05-30T17:59:30Z","title":"SheetCopilot: Bringing Software Productivity to the Next Level through Large Language Models","version":2},"cited_work":{"arxiv_id":"2305.19308","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.19308","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2305.19308 , year=","venue":null,"work_id":"4c1fe120-1f22-476e-a445-064bb98f3101","year":2023},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2305.19308","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:693c3bd2b851b3232b0f83bb1805dc9f921a8602f3ec71f06ffd73f5008e52d0","observation_id":"0f99749b-d19f-48cd-8994-b69744a70545","resolution":{"observed_at":"2026-05-13T01:19:32.558195Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":"2312.10665","doi":"10.48550/arxiv.2312.10665","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Silkie: Preference distillation for large visual lan- guage models","venue":"arXiv (Cornell University)","work_id":"dd1b128a-36d2-47ff-a48e-98f5d1e734be","year":2023},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:e0954f38447f8f5272f66f40a4f8bd0de408d4c17481404c08651564ca518ac5","observation_id":"233cdd86-cc0c-4292-a444-a54f32b7ff39","resolution":{"observed_at":"2026-05-13T01:19:32.561482Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.03776","last_updated":"2020-06-05T02:11:56Z","snapshot_observed_at":"2026-08-05T14:55:40.170766Z","submitted_at":"2020-05-07T21:41:40Z","title":"Mapping Natural Language Instructions to Mobile UI Action Sequences","version":2},"cited_work":{"arxiv_id":"2005.03776","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2005.03776","snapshot_observed_at":"2026-06-30T11:04:37.748508Z","title":"arXiv:2005.03776 [cs.CL] https://arxiv.org/abs/2005.03776","venue":null,"work_id":"f2c07a99-695e-4d24-a4a9-429c93d5af4a","year":2020},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2005.03776","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:5d6193e48a53531c45d2f3aef0e50f4455664c7a16fdc7e884769609bfd75d13","observation_id":"7e22006b-03c2-44ec-83c9-8832f1ef955c","resolution":{"observed_at":"2026-05-13T01:19:32.564185Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1960.450325","doi":"10.1109/thfe2.1960.4503259","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Natasha Chrissane Lobo, Himani H","venue":"IRE transactions on human factors in electronics","work_id":"275e63bf-eda8-42fe-8eed-fbef266de375","year":1960},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:794c961a39ae842e694ed524498da21873ad3fbe7d6a7e99eb8a5ccbd9ea803b","observation_id":"b4d586ca-ac0c-479e-9abf-d93c0ead8359","resolution":{"observed_at":"2026-05-13T01:19:32.434145Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-12T18:49:24.306128+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T18:49:24.306128+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.08979","last_updated":"2018-03-02T17:46:59Z","snapshot_observed_at":"2026-07-06T06:25:13.996890Z","submitted_at":"2018-02-25T09:52:24Z","title":"NL2Bash: A Corpus and Semantic Parser for Natural Language Interface to the Linux Operating System","version":2},"cited_work":{"arxiv_id":"1802.08979","doi":null,"metadata_source":"pith","pith_arxiv_id":"1802.08979","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"NL2Bash: A Corpus and Semantic Parser for Natural Language Interface to the Linux Operating System","venue":"cs.CL","work_id":"0e6faac7-a1a4-47d3-a99e-1bba468b0dc8","year":2018},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/1802.08979","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:97c6182373117e528cb91bd3871c33d6dc8f046af268d425bd6841acf15947b8","observation_id":"5b082a34-97f9-43d2-918d-30cdbf24c15c","resolution":{"observed_at":"2026-05-13T01:19:32.567035Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.08802","last_updated":"2018-02-24T05:32:47Z","snapshot_observed_at":"2026-07-06T06:25:09.401059Z","submitted_at":"2018-02-24T05:32:47Z","title":"Reinforcement Learning on Web Interfaces Using Workflow-Guided Exploration","version":1},"cited_work":{"arxiv_id":"1802.08802","doi":"10.48550/arxiv.1802.08802","metadata_source":"pith","pith_arxiv_id":"1802.08802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning on Web Interfaces Using Workflow-Guided Exploration","venue":"cs.AI","work_id":"a790be26-7c4c-4e58-ab4a-906e2570cc69","year":2018},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/1802.08802","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:fcf9197a63d74a6cd174d13146fd7a51a5bc966484fc9b2738afe350fe35208b","observation_id":"24a9e56a-825c-4ac6-87da-d6ccf2b2e8e0","resolution":{"observed_at":"2026-05-13T01:19:32.570023Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2304.08485","doi":"10.48550/arxiv.2304.08485","metadata_source":"pith","pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual Instruction Tuning","venue":"cs.CV","work_id":"68be622d-a6dc-4a13-82de-e3054a3dc509","year":2023},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:beced4ad79b63de0f8214f6e11c37d9ca86f57d3f40b9535bd203df75a0b1077","observation_id":"9a485cf8-67e6-4daf-879e-b0f154d78f8c","resolution":{"observed_at":"2026-05-13T01:19:32.572521Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:44.742124+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:44.742124+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03688","last_updated":"2025-10-04T03:54:18Z","snapshot_observed_at":"2026-08-06T20:36:41.418114Z","submitted_at":"2023-08-07T16:08:11Z","title":"AgentBench: Evaluating LLMs as Agents","version":3},"cited_work":{"arxiv_id":"2308.03688","doi":"10.1109/fllm63129.2024.10852426","metadata_source":"pith","pith_arxiv_id":"2308.03688","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AgentBench: Evaluating LLMs as Agents","venue":"cs.AI","work_id":"a37549b4-4c94-412d-acc4-4efeb08509be","year":2023},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2308.03688","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:797af6e9867a827772d3cc17ccbdb12361105574ee5f8cb42e1dcdbfb05ccde9","observation_id":"67eee199-5d51-4931-bb48-93df08cc5274","resolution":{"observed_at":"2026-05-13T01:19:32.575725Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2402.05930","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T01:59:24.672677Z","title":"Weblinx: Real-world website navigation with multi-turn dialogue","venue":null,"work_id":"af0d85bb-5b8c-48d8-bda3-9b1e5ca86b1b","year":2024},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:576a71fe7723ef1de43f8096156fdaeb4e1a96ed2262ac8ae01baf2be5c65851","observation_id":"0d395331-a1c3-4a85-95d2-fe597026794d","resolution":{"observed_at":"2026-05-13T01:19:32.578740Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13178","last_updated":"2024-12-23T20:12:48Z","snapshot_observed_at":"2026-07-06T17:19:44.130417Z","submitted_at":"2024-01-24T01:51:00Z","title":"AgentBoard: An Analytical Evaluation Board of Multi-turn LLM Agents","version":2},"cited_work":{"arxiv_id":"2401.13178","doi":"10.48550/arxiv.2401.13178","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.13178","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"NeurIPS / arXiv preprint 2401.13178","venue":"arXiv (Cornell University)","work_id":"64c5309b-a802-40af-bb4b-4fb9ecf315d8","year":2024},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2401.13178","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:712fc986db2549467ea105125f0277b3aeb8a74202f71ee999662b54f355051c","observation_id":"f76ff87a-3d72-4686-8967-5ffdc37f8e4c","resolution":{"observed_at":"2026-05-13T01:19:32.581967Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-20T08:23:32.642283+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T08:23:32.642283+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing meta Llama 3: The most capable openly available LLM to date, April","venue":null,"work_id":"f108a1d6-6e78-421c-b1ff-44c7fd284d8a","year":null},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:2f123864dcfbd7c7561d1e4adfa9355211a58bdfd0c9d9c316bdbd4404451778","observation_id":"ed603c44-1608-46e4-8b74-6f233d56c14e","resolution":{"observed_at":"2026-05-13T01:19:32.633727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Accessed: 2024-04-18","venue":null,"work_id":"7b878991-c7f9-45ac-af2c-ee68f21e4928","year":2024},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:27442025573b59d8d94b436389e942c618135608029269b05f02b634b3f25986","observation_id":"42d7b803-cec1-40c0-92f4-f1c27e04127b","resolution":{"observed_at":"2026-05-13T01:19:32.637770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12983","last_updated":"2023-11-21T20:34:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-21T20:34:47Z","title":"GAIA: a benchmark for General AI Assistants","version":1},"cited_work":{"arxiv_id":"2311.12983","doi":"10.48550/arxiv.2311.12983","metadata_source":"pith","pith_arxiv_id":"2311.12983","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GAIA: a benchmark for General AI Assistants","venue":"cs.CL","work_id":"cf222b33-f7a3-4044-a570-ecfe25edb3f8","year":2023},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2311.12983","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:c623b884799d21de8fc85021e3696e861d0f803bd2e459ca76f165954fd3a919","observation_id":"b9417b89-2f7a-4391-aa5e-be5c25c69c4e","resolution":{"observed_at":"2026-05-13T01:19:32.584711Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-20T18:52:17.222295+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T18:52:17.222295+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-07T17:14:39.278754Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":"2112.09332","doi":"10.48550/arxiv.2112.09332","metadata_source":"pith","pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebGPT: Browser-assisted question-answering with human feedback","venue":"cs.CL","work_id":"e25ef3e1-4848-4cb9-bf28-67a420591165","year":2021},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:c5deed7dc814354e4825004b801ae04eba6d2f7ad486d428821f9e40a87c6f66","observation_id":"a7e8feae-bdba-4547-ab11-e79a45a4179d","resolution":{"observed_at":"2026-05-13T01:19:32.587578Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:09.995583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:09.995583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07945","last_updated":"2024-02-09T02:33:45Z","snapshot_observed_at":"2026-08-03T19:20:57.982939Z","submitted_at":"2024-02-09T02:33:45Z","title":"ScreenAgent: A Vision Language Model-driven Computer Control Agent","version":1},"cited_work":{"arxiv_id":"2402.07945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.07945","snapshot_observed_at":"2026-07-03T05:17:40.260654Z","title":"arXiv preprint arXiv:2402.07945 (2024)","venue":null,"work_id":"bede3d3e-569e-4b38-bcda-882f9b24f36f","year":2024},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2402.07945","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:e75a58473761da44d6811a0ab09ab40f0ec116c742144b0083b7ed0922b24df0","observation_id":"6562f1dd-626a-405a-9b2c-07441364ccea","resolution":{"observed_at":"2026-05-13T01:19:32.591004Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:d0a053b61d6288e005e1ae3f3eabd7dcda61b03644cc3906032ab8d23efc529e","observation_id":"9cb6cda8-7862-40f7-bddc-353dacf7354b","resolution":{"observed_at":"2026-05-13T01:19:32.593875Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10088","last_updated":"2023-10-27T14:24:31Z","snapshot_observed_at":"2026-07-06T15:55:56.043012Z","submitted_at":"2023-07-19T15:57:24Z","title":"Android in the Wild: A Large-Scale Dataset for Android Device Control","version":2},"cited_work":{"arxiv_id":"2307.10088","doi":"10.48550/arxiv.2307.10088","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.10088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Android in the wild: A large-scale dataset for android device control","venue":"arXiv (Cornell University)","work_id":"a85f090f-dacb-478b-9ccf-0c2b52eb4a75","year":2023},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2307.10088","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:8502fe4707eb9b384f5f96f58fd7b270fead7678766be07d2ecf44f3b89a9bf7","observation_id":"62f91ddf-75f1-4bd0-9b39-51f2e90c0322","resolution":{"observed_at":"2026-05-13T01:19:32.597044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:4eec623a55824c2c0c98ee25ac1a984056e112f708125c0c96fcdeb280caf4a8","observation_id":"a6a85c12-7bab-4b87-b114-da4a0822f6f6","resolution":{"observed_at":"2026-05-13T01:19:32.600721Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An empirical study & evaluation of modern {CAPTCHAs}","venue":null,"work_id":"62b01c9f-8c5c-4ef5-93ed-743df3c5128b","year":2023},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:079589f826f67a05e334278f0523f3b397571d9dafca30f6dfe2b7433d0496bd","observation_id":"8c1ec10a-7474-423f-9a02-7857a3055474","resolution":{"observed_at":"2026-05-13T01:19:32.626988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00245","last_updated":"2023-12-06T23:46:36Z","snapshot_observed_at":"2026-07-06T15:36:15.352301Z","submitted_at":"2023-05-31T23:39:18Z","title":"From Pixels to UI Actions: Learning to Follow Instructions via Graphical User Interfaces","version":2},"cited_work":{"arxiv_id":"2306.00245","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.00245","snapshot_observed_at":"2026-06-30T07:14:21.226042Z","title":"From pixels to ui actions: Learning to follow instructions via graphical user interfaces","venue":null,"work_id":"7bdf55b6-5ec1-4c55-b878-b1d2e314b776","year":2023},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2306.00245","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:a0404bc2dd34784021cab01550d6a44678974957c364234670d2da5cc00f5bec","observation_id":"6b85d019-4022-467c-a17c-d13338099204","resolution":{"observed_at":"2026-05-13T01:19:32.604987Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"World of bits: An open-domain platform for web-based agents","venue":null,"work_id":"a51e85c8-02e4-423d-9c72-7751d8da6612","year":2017},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:4cff15adf21bfc41ad302e761ba3bf0975b66e6ad9fe8b7bd91cd8e7827a0947","observation_id":"f1f25d28-b1e9-4974-ae04-ce95df3823d7","resolution":{"observed_at":"2026-05-13T01:19:32.631174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Design2code: How far are we from automating front-end engineering?","venue":null,"work_id":"b077f947-29bf-48b4-8af5-b7d3b3ee6ec9","year":2024},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:a6beea474b64ef156d8e38b2fcfad60920536883b9cb8da386f8d6ac27c86637","observation_id":"43ba48cc-ed59-4645-90a3-6f6c49e8bd51","resolution":{"observed_at":"2026-05-13T01:19:32.639703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14257","last_updated":"2023-10-30T00:55:53Z","snapshot_observed_at":"2026-07-06T15:31:41.985646Z","submitted_at":"2023-05-23T17:10:39Z","title":"Hierarchical Prompting Assists Large Language Model on Web Navigation","version":3},"cited_work":{"arxiv_id":"2305.14257","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.14257","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"F., Zhu, H., and Zhou, S","venue":null,"work_id":"bcab0b81-9f08-4a18-969b-22fe22da617c","year":2023},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2305.14257","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:2716ec38803dc092f3fadbd9718b1355a58675775887d1798b3af3858fc60061","observation_id":"ae375c20-1860-4380-bebc-47473217e6e9","resolution":{"observed_at":"2026-05-13T01:19:32.472256Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11029","last_updated":"2022-11-24T06:34:43Z","snapshot_observed_at":"2026-07-06T13:12:39.361042Z","submitted_at":"2022-05-23T04:05:37Z","title":"META-GUI: Towards Multi-modal Conversational Agents on Mobile GUI","version":2},"cited_work":{"arxiv_id":"2205.11029","doi":"10.48550/arxiv.2205.11029","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.11029","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Meta-gui: Towards multi-modal conversational agents on mobile gui","venue":"arXiv (Cornell University)","work_id":"f851d535-6e3a-4013-9128-72eabefb2a3f","year":2022},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2205.11029","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:04d5708ac42416ee8431aa868237ea111cd485ca9d499857b525cb2160286a7c","observation_id":"72d4933d-b12f-4ed8-9cf4-9e3dbfffbb68","resolution":{"observed_at":"2026-05-13T01:19:32.475665Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03186","last_updated":"2024-07-02T17:23:13Z","snapshot_observed_at":"2026-08-01T15:59:13.226787Z","submitted_at":"2024-03-05T18:22:29Z","title":"Cradle: Empowering Foundation Agents Towards General Computer Control","version":3},"cited_work":{"arxiv_id":"2403.03186","doi":"10.48550/arxiv.2403.03186","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03186","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Karlsson, Bo An, and Zongqing Lu","venue":"arXiv (Cornell University)","work_id":"26d06504-a4fc-4807-8c42-74e709500f97","year":2024},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2403.03186","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:1ca091635bd19c0766c56d3518e2bcb3e4bf81de254e145e5c23dff74b0075b9","observation_id":"3dbbd82f-cbc1-4881-838f-499ed3fed62c","resolution":{"observed_at":"2026-05-13T01:19:32.478918Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:3cd3a2527b57d334f77b73654124a366a1e8dd2e24b5abc83029d5ccf8eca9d2","observation_id":"4800fce6-aa93-4591-bbd2-83312df9c5f3","resolution":{"observed_at":"2026-05-13T01:19:32.482620Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13231","last_updated":"2021-05-27T15:20:14Z","snapshot_observed_at":"2026-08-06T19:12:22.947026Z","submitted_at":"2021-05-27T15:20:14Z","title":"AndroidEnv: A Reinforcement Learning Platform for Android","version":1},"cited_work":{"arxiv_id":"2105.13231","doi":"10.48550/arxiv.2105.13231","metadata_source":"arxiv_reference","pith_arxiv_id":"2105.13231","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Androidenv: A reinforcement learning platform for android","venue":"arXiv (Cornell University)","work_id":"2286cbf7-58a4-4e56-b0fe-476969e1b990","year":2021},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2105.13231","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:21260bb8e8e071a20c64dbd8c62635acce71b223252be479d26fc8ee9d9d6b06","observation_id":"27243d42-c013-4d38-9b78-8e8a3ca53f0f","resolution":{"observed_at":"2026-05-13T01:19:32.485919Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.07615","last_updated":"2023-05-23T16:08:10Z","snapshot_observed_at":"2026-08-07T05:21:30.168684Z","submitted_at":"2022-11-14T18:36:19Z","title":"UGIF: UI Grounded Instruction Following","version":2},"cited_work":{"arxiv_id":"2211.07615","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.07615","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ugif: Ui grounded instruction following","venue":null,"work_id":"92f060fd-4814-4aac-bbdf-2d57ededeab0","year":2023},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2211.07615","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:c3914087089b789cf6150ed83369189ee69bf2e93a1a2068a5e6891f21ef8c73","observation_id":"c39cb77a-d7c0-4023-9b23-4ec4fb37272b","resolution":{"observed_at":"2026-05-13T01:19:32.490386Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:7cebcc1d5ff610257b1d34f19a30379a4847a0925a08ff517c2a981dfe2af342","observation_id":"7d4aba06-231e-4667-bfdf-ddc9ca440267","resolution":{"observed_at":"2026-05-17T00:19:28.048419Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.15272","last_updated":"2024-03-09T09:38:51Z","snapshot_observed_at":"2026-07-31T08:40:31.844458Z","submitted_at":"2023-08-29T13:02:30Z","title":"AutoDroid: LLM-powered Task Automation in Android","version":4},"cited_work":{"arxiv_id":"2308.15272","doi":"10.48550/arxiv.2308.15272","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.15272","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://doi.org/10.48550/arXiv.2308.15272","venue":"arXiv (Cornell University)","work_id":"dd57f5cf-e7c8-49f9-a2b5-1392cf9d000b","year":2024},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2308.15272","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:50b52a31b9707922157e65630887fd416aae8dc0a9b9672d7e4edeb38055f1ca","observation_id":"feede790-49c5-4d60-8560-df638d65c377","resolution":{"observed_at":"2026-05-13T01:19:32.497484Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14987","last_updated":"2022-03-28T18:00:51Z","snapshot_observed_at":"2026-07-06T12:53:50.496350Z","submitted_at":"2022-03-28T18:00:51Z","title":"Multilingual Knowledge Graph Completion with Self-Supervised Adaptive Graph Alignment","version":1},"cited_work":{"arxiv_id":"2203.14987","doi":"10.48550/arxiv","metadata_source":"doi_reference","pith_arxiv_id":"2203.14987","snapshot_observed_at":"2026-07-09T21:46:34.506658Z","title":"Dickerson","venue":"cs.AI","work_id":"5c2060c6-427c-4321-be22-49ccae439d80","year":2025},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2203.14987","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:cce6f310c716f4dcf44c016f3b0b059f25aeaca0632999b0aedcbd8256f48193","observation_id":"2e60b7d9-e453-49f4-a766-70025ed83707","resolution":{"observed_at":"2026-05-13T01:19:32.437346Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07562","last_updated":"2023-11-13T18:53:37Z","snapshot_observed_at":"2026-07-06T16:46:57.403995Z","submitted_at":"2023-11-13T18:53:37Z","title":"GPT-4V in Wonderland: Large Multimodal Models for Zero-Shot Smartphone GUI Navigation","version":1},"cited_work":{"arxiv_id":"2311.07562","doi":"10.48550/arxiv.2311.07562","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.07562","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gpt-4v in wonderland: Large multi- modal models for zero-shot smartphone gui navigation","venue":"arXiv (Cornell University)","work_id":"c31ca36a-fe7c-48e9-95e1-7f9bdf54ce89","year":2023},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2311.07562","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:e45fdd9fc77ce916f7ca47c378555a6af43eb29d83b0112a780bdfdd6f341a2b","observation_id":"1cbfd6e8-54ac-4c04-bb7a-bed3622f7ecf","resolution":{"observed_at":"2026-05-13T01:19:32.500326Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-04T03:29:49.409446Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":"2310.11441","doi":"10.48550/arxiv.2310.11441","metadata_source":"pith","pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","venue":"cs.CV","work_id":"ddc8878e-ed0c-4a66-952a-254dce1c622a","year":2023},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:18f8f64862c0a842e9645cbf64a81fe8d6eedf0e2e3c73f9cd0d79ea9868d17b","observation_id":"e14ca917-fbb4-4c6b-b54e-b0a838ad929c","resolution":{"observed_at":"2026-05-13T01:19:32.503391Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14898","last_updated":"2023-10-30T17:52:18Z","snapshot_observed_at":"2026-07-06T15:46:55.111790Z","submitted_at":"2023-06-26T17:59:50Z","title":"InterCode: Standardizing and Benchmarking Interactive Coding with Execution Feedback","version":3},"cited_work":{"arxiv_id":"2306.14898","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14898","snapshot_observed_at":"2026-06-29T11:23:20.895534Z","title":"Intercode: Standardizing and benchmarking interactive coding with execution feedback","venue":null,"work_id":"1c47eed5-7e6c-49c9-9060-401622d6c1e4","year":2023},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2306.14898","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:7824b725f3c028a0e3d5ca0575ee59ad9740d8a01fdb529ed1199304a5730cf5","observation_id":"4e88b8a0-fefd-425c-8f95-4aee49b6af53","resolution":{"observed_at":"2026-05-13T01:19:32.507302Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Webshop: Towards scalable real-world web interaction with grounded language agents","venue":null,"work_id":"3ce2bad0-228a-4a98-81af-18211aa430a8","year":2022},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:3ee665aaaf05b9aa481148e354ac8d09f977095a0626674a9013dadd0e20ccba","observation_id":"764786b0-f6f2-4864-bfdf-3f1703ee23d2","resolution":{"observed_at":"2026-05-13T01:19:32.641863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07939","last_updated":"2024-05-23T05:18:58Z","snapshot_observed_at":"2026-08-01T11:47:21.821212Z","submitted_at":"2024-02-08T15:40:35Z","title":"UFO: A UI-Focused Agent for Windows OS Interaction","version":5},"cited_work":{"arxiv_id":"2402.07939","doi":"10.48550/arxiv.2402.07939","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.07939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ufo: A ui-focused agent for windows os interaction","venue":"arXiv (Cornell University)","work_id":"70bc896f-9c76-4f30-9b81-5ac0d58e7af3","year":2024},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2402.07939","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:476ba277c6dd5290a10b8870cc73c33b63faa318479fa2adec1f9c3bc0aacb2b","observation_id":"4213af39-1902-4d97-9c4b-8f2ab1274964","resolution":{"observed_at":"2026-05-13T01:19:32.510117Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Appagent: Multimodal agents as smartphone users","venue":null,"work_id":"36f9aa45-f887-4749-9380-48a00e1f0125","year":2023},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:c2df449e360059d26b8709591f2d6673597c0e5fc219f4cedf6710c58e649b53","observation_id":"64c90358-97b4-4c97-8592-884c8405262b","resolution":{"observed_at":"2026-05-13T01:19:32.617660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08144","last_updated":"2024-06-13T11:51:37Z","snapshot_observed_at":"2026-07-06T15:26:58.583640Z","submitted_at":"2023-05-14T12:31:03Z","title":"Mobile-Env: Building Qualified Evaluation Benchmarks for LLM-GUI Interaction","version":4},"cited_work":{"arxiv_id":"2305.08144","doi":"10.48550/arxiv.2305.08144","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.08144","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-env: Building qualified evaluation benchmarks for llm-gui interaction.arXiv preprint arXiv:2305.08144","venue":"arXiv (Cornell University)","work_id":"5e21df21-0f7d-4810-9f61-f035ce87bcaf","year":2023},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2305.08144","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:ea51d15da6ab246ad3a3883494b47463a1d56dfc503f8f45bacfba125249c1ca","observation_id":"f07dabaf-84a0-4a60-a6ef-c1db6abd67e7","resolution":{"observed_at":"2026-05-13T01:19:32.513206Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large language models are semi-parametric reinforcement learning agents","venue":null,"work_id":"1c6214c9-3bd3-4d32-9b52-a1423f023940","year":2024},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:c3a2832ca717b159e2bd66fb3fe93de45a1db887a073b75489f97d2c4aded9f6","observation_id":"a00b3e49-e9e3-4285-8762-0d6e6b0c7d32","resolution":{"observed_at":"2026-05-13T01:19:32.629086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"You only look at screens: Multimodal chain-of-action agents","venue":null,"work_id":"1a8cea50-d648-45e0-af89-3a1dc9e5fe2b","year":2023},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:ffc4cf5f15e7092296cefef41b6c9b96356ae3b6e9a239fcda679ba79b62e17e","observation_id":"19d6f11c-6204-4b84-9921-77b95068b8ab","resolution":{"observed_at":"2026-05-13T01:19:32.610216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tie: Topological information enhanced structural reading comprehension on web pages","venue":null,"work_id":"1a1b07ac-9bc1-4a9a-b931-7de027f090c1","year":2022},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:beabe75d1fcdb5810a377ba12a324cd1e80e99d3f9c58167e9787a67e3128908","observation_id":"1f9b0c30-bc9e-4c26-9274-16972c236550","resolution":{"observed_at":"2026-05-13T01:19:32.620251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01614","last_updated":"2024-03-12T23:14:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-03T08:33:09Z","title":"GPT-4V(ision) is a Generalist Web Agent, if Grounded","version":2},"cited_work":{"arxiv_id":"2401.01614","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.01614","snapshot_observed_at":"2026-07-08T16:15:06.143411Z","title":"GPT-4V(ision) is a Generalist Web Agent, if Grounded","venue":"cs.IR","work_id":"d3503fef-7f64-4dcc-8aca-1f16e997034f","year":2024},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2401.01614","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:b306d850bfe09f5eaaa6da15fd7fb79abee21b5ec498c2f03bfa1425cf6239a3","observation_id":"e91e920a-ed79-432e-b80b-fa8bd9a595bb","resolution":{"observed_at":"2026-05-15T19:40:14.169994Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13854","last_updated":"2024-04-16T15:13:18Z","snapshot_observed_at":"2026-08-06T12:47:01.809185Z","submitted_at":"2023-07-25T22:59:32Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","version":4},"cited_work":{"arxiv_id":"2307.13854","doi":"10.48550/arxiv.2307.13854","metadata_source":"pith","pith_arxiv_id":"2307.13854","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","venue":"cs.AI","work_id":"7058ffd2-a339-4102-89eb-248eeb074652","year":2023},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2307.13854","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:8b502b3bacaa721435a5abcde18e0950b4e58ec03caa632a710596c6348590ff","observation_id":"55e8ff2e-054e-4603-b32e-b7f878eff23e","resolution":{"observed_at":"2026-05-13T01:19:32.519332Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-20T18:52:18.85917+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T18:52:18.85917+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":"2304.10592","doi":"10.18653/v1/2024.findings-emnlp.692","metadata_source":"pith","pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","venue":"cs.CV","work_id":"a7e3a737-e007-42bc-be89-c4d34c5ee071","year":2023},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:ed6d3efdc874398b0ecf01c1ce00102f7f8c159176ffbfc30c8fd0595825ebfb","observation_id":"78c207b4-616f-4c9c-9242-06017dc48947","resolution":{"observed_at":"2026-05-13T01:19:32.522499Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":2,"metadata_mismatch":8,"parse_uncertain":0,"unresolved":1,"verified_exact":42,"verified_fuzzy":15},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 100 inbound Pith citation observations for arXiv:2404.07972."}