{"as_of":"2026-08-06T14:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:363f7eb8b6b2cad32512ed412bc2561a58e4a740a1e09c09e26663f90bc6de59","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T23:05:27.821099Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T21:28:58.598336Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"cited_work":{"arxiv_id":"2605.13527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.13527","snapshot_observed_at":"2026-07-03T21:28:58.598336Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","venue":"cs.AI","work_id":"51fb1e95-531c-4374-abe2-0529fa06ca0c","year":2026},"citing_paper":{"arxiv_id":"2606.18448","last_updated":"2026-06-16T19:57:07Z","snapshot_observed_at":"2026-08-02T08:56:24.752597Z","submitted_at":"2026-06-16T19:57:07Z","title":"VISUALSKILL: Multimodal Skills for Computer-Use Agents","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-27T00:35:02.162386Z"},"links":{"cited_paper":"/paper/2605.13527","citing_paper":"/paper/2606.18448"},"observation_digest":"sha256:cf3e098cc8ea59cadd7642aaaa34fd2598761d6c4aaead721b4ad21ce95e2104","observation_id":"702efe0b-ac8e-46d6-8d36-888bc44bc171","resolution":{"observed_at":"2026-07-03T21:28:58.599988Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.13527","snapshot_observed_at":"2026-08-04T23:05:27.821099Z","title":"arXiv preprint arXiv:2605.13527 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01678","last_updated":"2026-08-03T04:14:59Z","snapshot_observed_at":"2026-08-06T14:25:06.549486Z","submitted_at":"2026-08-03T04:14:59Z","title":"Progressive Agent Skill Generation via Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T23:05:27.821099Z"},"links":{"cited_paper":"/paper/2605.13527","citing_paper":"/paper/2608.01678"},"observation_digest":"sha256:896702998c48b0a15244d262cb93cdcb9f652d21174de9558af9ca532048ffc7","observation_id":"d40bb2e2-fc90-4791-a14a-fdce8722497c","resolution":{"observed_at":"2026-08-04T23:05:27.821099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.13527/citation-record","integrity":"/paper/2605.13527/integrity","json":"/paper/2605.13527/citation-record.json","paper":"/paper/2605.13527"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.08164","last_updated":"2024-10-10T17:43:51Z","snapshot_observed_at":"2026-07-06T19:31:23.072307Z","submitted_at":"2024-10-10T17:43:51Z","title":"Agent S: An Open Agentic Framework that Uses Computers Like a Human","version":1},"cited_work":{"arxiv_id":"2410.08164","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.08164","snapshot_observed_at":"2026-07-03T16:08:37.200822Z","title":"Agent s: An open agentic framework that uses computers like a human","venue":null,"work_id":"743d8ba1-e742-4bc5-9035-81021a53b57a","year":2024},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2410.08164","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:366287e771213e080e2fb2c1e2d7b68d24c7acc284630c80a9c22d1654710a97","observation_id":"27f60dd1-2323-4e7e-8558-d4e2245774ab","resolution":{"observed_at":"2026-06-30T21:35:04.539803Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":"2204.01691","doi":"10.48550/arxiv.2204.01691","metadata_source":"pith","pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","venue":"cs.RO","work_id":"037320f1-b0a9-4cbe-a639-bfb25409ce71","year":2022},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:6c0314d42133a9a4306da2092e0b9d197ffdf59a0d8f06aebc9294b30ad116d2","observation_id":"3404e158-0908-4681-bd78-52d75c500e8d","resolution":{"observed_at":"2026-06-30T21:35:04.553070Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.02766","last_updated":"2026-03-03T09:07:22Z","snapshot_observed_at":"2026-08-04T19:32:12.955430Z","submitted_at":"2026-03-03T09:07:22Z","title":"EvoSkill: Automated Skill Discovery for Multi-Agent Systems","version":1},"cited_work":{"arxiv_id":"2603.02766","doi":"10.48550/arxiv.2603.02766","metadata_source":"pith","pith_arxiv_id":"2603.02766","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EvoSkill: Automated Skill Discovery for Multi-Agent Systems","venue":"cs.AI","work_id":"94c2c7b2-0c94-4b32-90cc-bc154d192850","year":2026},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2603.02766","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:4f201572a290c5f771c7c28fd77376362713a16b96f22ec5ceadcabc10cfaa42","observation_id":"7c5ea0d4-d852-4801-beab-83f5d2c2ce0d","resolution":{"observed_at":"2026-06-30T21:35:04.564993Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:431582110dff8f959b5320aedae9a4834753516aad5e255f3a153f83edf3312d","observation_id":"bcc50edf-73f8-4ac3-9788-e5fd9fc07dc4","resolution":{"observed_at":"2026-06-30T21:35:04.531773Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-02T11:20:36.216220Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":"2308.14508","doi":"10.48550/arxiv.2308.14508","metadata_source":"pith","pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","venue":"cs.CL","work_id":"ba7831c4-9427-4e0e-a5c1-4e98511f4b53","year":2023},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:a5fdf6714d710fa01a8383caf6db00a3b7b832f922587b379a6ffadc02d9f9b6","observation_id":"c9ba6989-a8b5-4648-9d8e-c9d592447fdb","resolution":{"observed_at":"2026-06-30T21:35:04.567653Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.21123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T21:28:58.604302Z","title":"Cua-skill: Develop skills for computer using agent","venue":null,"work_id":"28eae16a-d396-41a7-9ddd-954637759251","year":2026},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:ce9dc990f2dcdd5966fc9c475934f78b56baafa587d7f0ba2ae18d4869b0df12","observation_id":"3392dde1-a5a7-4dff-9ad1-10d98d94482b","resolution":{"observed_at":"2026-06-30T21:35:04.570747Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.505","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SeeClick: Harnessing GUI grounding for advanced visual GUI agents","venue":null,"work_id":"b6995d62-fe9c-46ef-9a41-38b0179ed138","year":2024},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:84d8db7506a7f2b67d30d811294e43109ac1efde5ae076a4d01b95ec6542b79a","observation_id":"1ac47709-125b-4b0b-a94a-6c1fe1b96c22","resolution":{"observed_at":"2026-06-30T21:35:04.028125Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T19:20:30.157565+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T19:20:30.157565+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06070","last_updated":"2023-12-09T05:57:46Z","snapshot_observed_at":"2026-07-06T15:40:50.807376Z","submitted_at":"2023-06-09T17:44:31Z","title":"Mind2Web: Towards a Generalist Agent for the Web","version":3},"cited_work":{"arxiv_id":"2306.06070","doi":"10.48550/arxiv.2306.06070","metadata_source":"pith","pith_arxiv_id":"2306.06070","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mind2Web: Towards a Generalist Agent for the Web","venue":"cs.CL","work_id":"e26f5a00-c007-439d-83f6-7900f5687b6b","year":2023},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2306.06070","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:85229c0d615b57360050dc941c60439733354a92c07ca607dde55101ecf22797","observation_id":"f9c180a3-5e0f-49ba-899a-d1423645518c","resolution":{"observed_at":"2026-06-30T21:35:04.573142Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:29.437492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:29.437492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05243","last_updated":"2025-06-17T15:06:02Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:47:50Z","title":"Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents","version":3},"cited_work":{"arxiv_id":"2410.05243","doi":"10.48550/arxiv.2410.05243","metadata_source":"pith","pith_arxiv_id":"2410.05243","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents","venue":"cs.AI","work_id":"9def1724-6fd2-4d5b-8339-4c1ee76e62f8","year":2024},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2410.05243","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:6ce19d36f9eaa5b9c2c3a7d3c7af193bbfb002a403bdd5df0a9bb4819a4d1b2e","observation_id":"a5d0bb76-3bb8-4243-98c6-88069d3677a3","resolution":{"observed_at":"2026-06-30T21:35:04.554540Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.371","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Webvoyager: Building an end-to-end web agent with large multimodal models","venue":null,"work_id":"5549b83c-a0a2-4e60-ac23-4e941c945664","year":2024},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:464f72d1dd456e30c45c6d43ad37299d03a9d8544d3845a9b1dfd6ec8d1f9d40","observation_id":"2d08272c-fa46-4bac-983d-5a6ae8850db4","resolution":{"observed_at":"2026-06-30T21:35:04.018795Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-24T02:24:35.193099+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T02:24:35.193099+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:8157404163739cee8b67e3c2e74764b4291ecf522b1af794c73f9ce63c3501f9","observation_id":"94636b68-cf0c-4e6c-ae31-eed6da1a0af7","resolution":{"observed_at":"2026-06-30T21:35:04.557252Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15146","last_updated":"2025-06-03T09:53:37Z","snapshot_observed_at":"2026-07-06T21:27:37.409259Z","submitted_at":"2025-05-21T06:02:55Z","title":"lmgame-Bench: How Good are LLMs at Playing Games?","version":2},"cited_work":{"arxiv_id":"2505.15146","doi":"10.48550/arxiv.2505.15146","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Xing, Ion Stoica, Tajana Rosing, Haojian Jin, and Hao Zhang","venue":"ArXiv.org","work_id":"10ddd4f7-8f21-466f-b975-f64ea89b9b2e","year":2025},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2505.15146","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:6f82889d5bd3a7ee04afa2e9941fa36eac996458b6c97f2d25804cd21b2a75c2","observation_id":"1d368f40-3266-41ea-8cdd-8b9fb6fa95df","resolution":{"observed_at":"2026-06-30T21:35:04.559898Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1162/neco_a_00393","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URL https: //doi.org/10.1162/NECO_a_00393","venue":"Neural Computation","work_id":"1c90dc69-0035-48bb-9aa6-a78e5afc98e6","year":2013},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:bfc91439e5078a3da9d4ce8c5a2ab5afcf39db1b979c1db8b43bed1100ad1515","observation_id":"0287352e-4c26-41e5-ad64-53153b595a65","resolution":{"observed_at":"2026-06-30T21:35:04.020654Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.12056","last_updated":"2026-07-01T10:34:53Z","snapshot_observed_at":"2026-08-06T06:55:10.869957Z","submitted_at":"2026-03-12T15:25:57Z","title":"XSkill: Continual Learning from Experience and Skills in Multimodal Agents","version":3},"cited_work":{"arxiv_id":"2603.12056","doi":"10.48550/arxiv.2603.12056","metadata_source":"pith","pith_arxiv_id":"2603.12056","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Xskill: Continual learning from experience and skills in multimodal agents","venue":"cs.AI","work_id":"6bec6eef-86ec-49a5-a730-a01e19656d75","year":2026},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2603.12056","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:e76088bd4e49eccfa82504b26f1d928046fc8cf30075c4d64985b5da425a5b50","observation_id":"979ab9c9-eef2-4982-920c-ee23418528e0","resolution":{"observed_at":"2026-07-02T02:17:26.572211Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.50","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VisualWebArena: Evaluating multimodal agents on realistic visual web tasks","venue":null,"work_id":"7a18db33-5a35-436c-ba83-41b4602aea68","year":2024},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:9fd28a47de9167e10bd2c9695501c069cd93eaa1fac61e4dc55ee017498e1911","observation_id":"4087e90b-091f-4724-93f4-c624695fe047","resolution":{"observed_at":"2026-06-30T21:35:04.034096Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T19:20:32.353486+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T19:20:32.353486+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8891.2023","doi":"10.1109/icra48891.2023","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ImmFusion: Robust mmWave-RGB Fusion for 3D Human Body Reconstruction in All Weather Conditions","venue":null,"work_id":"fafcadb0-b1fa-4b90-99aa-b36501c38439","year":2023},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:249be6eb5152592873bfd66f68786501768a0bf674e295f79749131f0dc59347","observation_id":"01b9da5e-81cb-4be0-abad-2355726a4b21","resolution":{"observed_at":"2026-06-30T21:35:04.025940Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:16.40985+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:16.40985+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03172","last_updated":"2023-11-20T23:09:34Z","snapshot_observed_at":"2026-07-06T15:51:12.179086Z","submitted_at":"2023-07-06T17:54:11Z","title":"Lost in the Middle: How Language Models Use Long Contexts","version":3},"cited_work":{"arxiv_id":"2307.03172","doi":"10.1162/tacl","metadata_source":"pith","pith_arxiv_id":"2307.03172","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Lost in the Middle: How Language Models Use Long Contexts","venue":"cs.CL","work_id":"37c05e13-4a24-44f8-a1c4-da1bbe7223aa","year":2023},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2307.03172","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:fb3cdafbb1e7b2cb80a30a169c5bcbd11ba033319873fdbc08785d4709513b73","observation_id":"542aed55-042d-4ba5-a172-7ad1f4a18820","resolution":{"observed_at":"2026-06-30T21:35:04.023262Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.04323","last_updated":"2026-04-06T00:10:30Z","snapshot_observed_at":"2026-07-06T22:53:20.122451Z","submitted_at":"2026-04-06T00:10:30Z","title":"How Well Do Agentic Skills Work in the Wild: Benchmarking LLM Skill Usage in Realistic Settings","version":1},"cited_work":{"arxiv_id":"2604.04323","doi":"10.48550/arxiv.2604.04323","metadata_source":"pith","pith_arxiv_id":"2604.04323","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"How Well Do Agentic Skills Work in the Wild: Benchmarking LLM Skill Usage in Realistic Settings","venue":"cs.CL","work_id":"1298ec8c-0f55-41e8-b684-19c3f512378d","year":2026},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2604.04323","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:d9b251278f89040e1927e588cf876016b2d38bf24388a3ce21cd3fae18185959","observation_id":"5754cc06-b451-4cb4-a214-f528d2cfef92","resolution":{"observed_at":"2026-06-30T21:35:04.543425Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00203","last_updated":"2024-08-01T00:00:43Z","snapshot_observed_at":"2026-07-06T18:55:19.894571Z","submitted_at":"2024-08-01T00:00:43Z","title":"OmniParser for Pure Vision Based GUI Agent","version":1},"cited_work":{"arxiv_id":"2408.00203","doi":"10.48550/arxiv.2408.00203","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.00203","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omniparser for pure vision based gui agent","venue":"arXiv (Cornell University)","work_id":"a17adac7-d7c5-4410-9509-13b1d0cab0ce","year":2024},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2408.00203","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:682883dc48bbae753c666a605fcc7660dac6b35057d7cf2c47bce8dbacdd706e","observation_id":"1edb1189-7738-40a4-9a4b-387635fc2c22","resolution":{"observed_at":"2026-06-30T21:35:04.549327Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08377","last_updated":"2026-04-09T15:38:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T15:38:27Z","title":"SkillClaw: Let Skills Evolve Collectively with Agentic Evolver","version":1},"cited_work":{"arxiv_id":"2604.08377","doi":"10.48550/arxiv.2604.08377","metadata_source":"pith","pith_arxiv_id":"2604.08377","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"SkillClaw: Let Skills Evolve Collectively with Agentic Evolver","venue":"cs.AI","work_id":"31a44ebb-9aae-4719-8d62-50f8c82ece16","year":2026},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2604.08377","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:bea989f42f60b79affc63e5bc6460875ce3b6b868dfc66bcafb1a4e13c7d5330","observation_id":"20ce9619-cb9a-4aa5-a70d-2ab5746ca70d","resolution":{"observed_at":"2026-06-30T21:35:04.580530Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1017/cbo9780511811678","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T21:35:04.028681Z","title":"URL https://doi.org/ 10.1017/CBO9780511811678","venue":null,"work_id":"422b6fe2-d550-4cba-b6dc-a0d96df44d9a","year":null},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:cc35f68e785e0dcccbc0ac01dccf02c06987f00d4bd8a53a2598d77c820bb8c3","observation_id":"542e943b-0bd4-46d0-a554-da29ca0c95b1","resolution":{"observed_at":"2026-06-30T21:35:04.030066Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08560","last_updated":"2024-02-12T18:59:46Z","snapshot_observed_at":"2026-08-03T06:31:15.541423Z","submitted_at":"2023-10-12T17:51:32Z","title":"MemGPT: Towards LLMs as Operating Systems","version":2},"cited_work":{"arxiv_id":"2310.08560","doi":"10.48550/arxiv.2310.08560","metadata_source":"pith","pith_arxiv_id":"2310.08560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MemGPT: Towards LLMs as Operating Systems","venue":"cs.AI","work_id":"2698f5ad-c84c-40ca-b839-0912dae10ba2","year":2023},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2310.08560","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:95b33e879228671ae070861961dff98e543e3906e3f5b6a18af745969f874c54","observation_id":"17e48366-d340-4fb1-a2c8-84c073bb9bbd","resolution":{"observed_at":"2026-06-30T21:35:04.583018Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:35.543803+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:35.543803+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03442","last_updated":"2023-08-06T00:21:19Z","snapshot_observed_at":"2026-07-06T15:13:13.695535Z","submitted_at":"2023-04-07T01:55:19Z","title":"Generative Agents: Interactive Simulacra of Human Behavior","version":2},"cited_work":{"arxiv_id":"2304.03442","doi":"10.1001/jamapsychiatry.2022.0609","metadata_source":"pith","pith_arxiv_id":"2304.03442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generative Agents: Interactive Simulacra of Human Behavior","venue":"cs.HC","work_id":"01f7ddaa-284a-441a-be87-921aad4dc54b","year":2023},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2304.03442","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:17ded0dbc1fa2f22cda0c36b532442fd9d07f79b1ecfe16bdfb89982a4c9ff3f","observation_id":"788c8ecb-23b7-4bee-bc96-179de575995e","resolution":{"observed_at":"2026-06-30T21:35:04.562519Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-24T05:54:33.103795+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T05:54:33.103795+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-07-06T20:23:58.426780Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":"2501.12326","doi":"10.48550/arxiv.2501.12326","metadata_source":"pith","pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","venue":"cs.AI","work_id":"0bbcf263-a46d-4525-a438-11fce3316568","year":2025},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:e48f52bcd7ca736588ff235ff12e335917a4d647f926cdd271ed57716434c1e2","observation_id":"8fb550e3-a08d-4eb1-aa7c-44136aaa74aa","resolution":{"observed_at":"2026-06-30T21:35:04.540664Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:19.638951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:19.638951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10088","last_updated":"2023-10-27T14:24:31Z","snapshot_observed_at":"2026-07-06T15:55:56.043012Z","submitted_at":"2023-07-19T15:57:24Z","title":"Android in the Wild: A Large-Scale Dataset for Android Device Control","version":2},"cited_work":{"arxiv_id":"2307.10088","doi":"10.48550/arxiv.2307.10088","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.10088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Android in the wild: A large-scale dataset for android device control","venue":"arXiv (Cornell University)","work_id":"a85f090f-dacb-478b-9ccf-0c2b52eb4a75","year":2023},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2307.10088","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:5f5c0f2616ed726e3405956c93551391c207a4b476a99e32db0172fa611dc116","observation_id":"9405978a-5fbe-4e3a-90a0-cfe5cee7c255","resolution":{"observed_at":"2026-06-30T21:35:04.546582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14573","last_updated":"2025-04-06T20:37:50Z","snapshot_observed_at":"2026-07-06T18:18:39.093732Z","submitted_at":"2024-05-23T13:48:54Z","title":"AndroidWorld: A Dynamic Benchmarking Environment for Autonomous Agents","version":5},"cited_work":{"arxiv_id":"2405.14573","doi":"10.48550/arxiv.2405.14573","metadata_source":"pith","pith_arxiv_id":"2405.14573","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AndroidWorld: A Dynamic Benchmarking Environment for Autonomous Agents","venue":"cs.AI","work_id":"c5116d19-d3d3-40fd-9620-f7489812a9ba","year":2024},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2405.14573","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:bc713a2ae3c7f63f2005d86ec18b451a996562b68d4d5b2da5c25b1a7834d928","observation_id":"b8502d64-b27a-4b45-b0e2-b68c71a1a255","resolution":{"observed_at":"2026-06-30T21:35:04.578198Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T16:53:57.383096Z","title":"nips.cc/paper_files/paper/2023/hash/1b44b878bb782e6954cd888628510e90-Abstract-Conference.html","venue":null,"work_id":"5f3a0f3f-a092-495a-a88a-c7bdceb2571e","year":2023},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:bace1ec5e14fb4e2bae8be53fee51d7069bc2a7d3d4134144a3f1fdd0ca30b87","observation_id":"a372cebe-cfda-4c19-a95a-4794b8b719e8","resolution":{"observed_at":"2026-07-07T16:53:57.384410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":"2602.02276","doi":"10.48550/arxiv.2602.02276","metadata_source":"pith","pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi K2.5: Visual Agentic Intelligence","venue":"cs.CL","work_id":"d690be8f-5d53-49b0-b1e7-79668eb8fcdb","year":2026},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:c57acd95ae2c4d4c2966c0f50cbb6dbef4b5804f3df4579082cfbfe14705a9b2","observation_id":"47b3dbea-0a21-4aac-a219-8fdd899775fb","resolution":{"observed_at":"2026-06-30T21:35:04.032447Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01560","last_updated":"2024-07-08T05:56:47Z","snapshot_observed_at":"2026-08-02T14:50:04.461434Z","submitted_at":"2023-02-03T06:06:27Z","title":"Describe, Explain, Plan and Select: Interactive Planning with Large Language Models Enables Open-World Multi-Task Agents","version":3},"cited_work":{"arxiv_id":"2302.01560","doi":"10.48550/arxiv.2302.01560","metadata_source":"pith","pith_arxiv_id":"2302.01560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Describe, Explain, Plan and Select: Interactive Planning with Large Language Models Enables Open-World Multi-Task Agents","venue":"cs.AI","work_id":"94908c37-3d13-4530-adc9-1d6814616759","year":2023},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2302.01560","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:fb2e3ae25ae90ddcc81e75d8a4346898067aff7e6357a8dba63d3cafb18547fb","observation_id":"d6c43618-8764-4b86-98a2-895dde225359","resolution":{"observed_at":"2026-06-30T21:35:04.531961Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.08234","last_updated":"2026-02-09T03:17:17Z","snapshot_observed_at":"2026-07-06T22:45:05.823859Z","submitted_at":"2026-02-09T03:17:17Z","title":"SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2602.08234","doi":"10.48550/arxiv.2602.08234","metadata_source":"pith","pith_arxiv_id":"2602.08234","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning","venue":"cs.LG","work_id":"536a9d0a-baed-4eb9-9a51-f2b585c3388b","year":2026},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2602.08234","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:3d39850618b3170ed604f71631ac61b4b403ff38e910e303a2fe566b1a815dea","observation_id":"b45f1b66-cccf-415e-8da9-d36a804694f2","resolution":{"observed_at":"2026-06-30T21:35:04.575834Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10387","last_updated":"2025-06-12T06:21:19Z","snapshot_observed_at":"2026-08-05T15:44:52.359920Z","submitted_at":"2025-06-12T06:21:19Z","title":"Mirage-1: Augmenting and Updating GUI Agent with Hierarchical Multimodal Skills","version":1},"cited_work":{"arxiv_id":"2506.10387","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10387","snapshot_observed_at":"2026-06-30T21:35:04.527792Z","title":"Mirage-1: Augmenting and updating gui agent with hierarchical multimodal skills.arXiv preprint arXiv:2506.10387","venue":null,"work_id":"ba5bc0df-5aa8-497c-9121-7b4ac95aa9bb","year":2025},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2506.10387","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:b5fcf43400ad2dfb832065479ed0b37dc8097f3eaa0fbd620a9a98537a75a624","observation_id":"c2f5d302-2ccc-409b-8ec0-593dd6d874ea","resolution":{"observed_at":"2026-06-30T21:35:04.529397Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12430","last_updated":"2026-06-02T16:14:54Z","snapshot_observed_at":"2026-08-06T11:11:16.632352Z","submitted_at":"2026-02-12T21:33:25Z","title":"Agent Skills for Large Language Models: Architecture, Acquisition, Security, and the Path Forward","version":4},"cited_work":{"arxiv_id":"2602.12430","doi":"10.48550/arxiv.2602.12430","metadata_source":"pith","pith_arxiv_id":"2602.12430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agent Skills for Large Language Models: Architecture, Acquisition, Security, and the Path Forward","venue":"cs.MA","work_id":"a64d3985-6826-492c-8a2e-f0965d805bfd","year":2026},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2602.12430","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:39ac36026d095877282b454a94a277c906e67c308426dabb3d2fd0944a2adb7a","observation_id":"65319806-9555-4e7f-86a3-80378cb86217","resolution":{"observed_at":"2026-06-30T21:35:04.534667Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11170","last_updated":"2025-03-14T08:16:02Z","snapshot_observed_at":"2026-07-06T20:52:32.324249Z","submitted_at":"2025-03-14T08:16:02Z","title":"DeskVision: Large Scale Desktop Region Captioning for Advanced GUI Agents","version":1},"cited_work":{"arxiv_id":"2503.11170","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.11170","snapshot_observed_at":"2026-06-30T21:35:04.517827Z","title":"Jingyi Yang, Shuai Shao, Dongrui Liu, and Jing Shao","venue":null,"work_id":"eb871075-9634-4112-809d-fa5daa3b5fe6","year":null},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2503.11170","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:e1d7f135ffeb3ad97b4be8dabd92c7c964ff5909cabee64972d2c97d30536995","observation_id":"6eb4e3bf-a14c-45f1-82a2-4d718435a0b5","resolution":{"observed_at":"2026-06-30T21:35:04.519678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13771","last_updated":"2026-07-05T07:51:04Z","snapshot_observed_at":"2026-08-04T19:11:48.797552Z","submitted_at":"2023-12-21T11:52:45Z","title":"AppAgent: Multimodal Agents as Smartphone Users","version":3},"cited_work":{"arxiv_id":"2312.13771","doi":"10.48550/arxiv.2312.13771","metadata_source":"pith","pith_arxiv_id":"2312.13771","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AppAgent: Multimodal Agents as Smartphone Users","venue":"cs.CV","work_id":"c3239910-590f-4891-bf7e-c462ffee2e9d","year":2023},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2312.13771","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:bcb90b5902377e32a1f1ea01922efe171132dbfc27320692c7471d12465ccaa8","observation_id":"4832a7eb-97d6-44da-bc89-bc085fb57c55","resolution":{"observed_at":"2026-06-30T21:35:04.526584Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11119","last_updated":"2024-09-08T04:25:32Z","snapshot_observed_at":"2026-08-03T00:16:04.029876Z","submitted_at":"2024-04-17T07:07:41Z","title":"DREAM: A Dual Representation Learning Model for Multimodal Recommendation","version":2},"cited_work":{"arxiv_id":"2404.11119","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.11119","snapshot_observed_at":"2026-06-30T21:35:04.520851Z","title":"Kangning Zhang, Wenxiang Jiao, Kounianhua Du, Yuan Lu, Weiwen Liu, Weinan Zhang, and Yong Yu","venue":null,"work_id":"c189fa25-c708-415b-a64d-40ec26bb5caf","year":null},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2404.11119","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:2aabd0fa76873b1d83efbaa3de743696680eee0ad7d62cee35403afdb78dffaf","observation_id":"1c3874fc-d936-40cb-b361-4736247cd03b","resolution":{"observed_at":"2026-06-30T21:35:04.522570Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.09148","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T13:55:46.338705Z","title":"Boyuan Zheng, Boyu Gou, Jihyung Kil, Huan Sun, and Yu Su","venue":null,"work_id":"b218ccea-9b01-4a0a-b47a-669e7bcaee03","year":2025},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:86f0c9200b7fa0d141cabdda8d9cc6148a85fc3a468b7313fc2d03b35d540b27","observation_id":"00a25186-d3ee-4694-b252-d75c54fde55e","resolution":{"observed_at":"2026-06-30T21:35:04.537817Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01614","last_updated":"2024-03-12T23:14:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-03T08:33:09Z","title":"GPT-4V(ision) is a Generalist Web Agent, if Grounded","version":2},"cited_work":{"arxiv_id":"2401.01614","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.01614","snapshot_observed_at":"2026-07-08T16:15:06.143411Z","title":"GPT-4V(ision) is a Generalist Web Agent, if Grounded","venue":"cs.IR","work_id":"d3503fef-7f64-4dcc-8aca-1f16e997034f","year":2024},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2401.01614","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:fe8a8de1935929aa4b5a3d2e829f1a0fab6ad058d706eb67056b0b0f9f9d0ecd","observation_id":"83b02c05-c62d-40b7-aca2-02fac7f769a8","resolution":{"observed_at":"2026-06-30T21:35:04.507748Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07079","last_updated":"2025-04-09T17:51:50Z","snapshot_observed_at":"2026-07-06T21:06:50.056353Z","submitted_at":"2025-04-09T17:51:50Z","title":"SkillWeaver: Web Agents can Self-Improve by Discovering and Honing Skills","version":1},"cited_work":{"arxiv_id":"2504.07079","doi":"10.48550/arxiv.2504.07079","metadata_source":"pith","pith_arxiv_id":"2504.07079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SkillWeaver: Web Agents can Self-Improve by Discovering and Honing Skills","venue":"cs.AI","work_id":"72b1aff0-91c3-4500-abc9-22129ca67748","year":2025},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2504.07079","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:3c8b4c63a202acac9ffc178a378c74764fe40133f8986a759e522cf33897e0ad","observation_id":"050be9a3-a594-4c99-b9c3-26a3f3550514","resolution":{"observed_at":"2026-06-30T21:35:04.537066Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13854","last_updated":"2024-04-16T15:13:18Z","snapshot_observed_at":"2026-08-06T12:47:01.809185Z","submitted_at":"2023-07-25T22:59:32Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","version":4},"cited_work":{"arxiv_id":"2307.13854","doi":"10.48550/arxiv.2307.13854","metadata_source":"pith","pith_arxiv_id":"2307.13854","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","venue":"cs.AI","work_id":"7058ffd2-a339-4102-89eb-248eeb074652","year":2023},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2307.13854","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:9f0492699b672e6b6ac2432bdf339cdb718ebd67486f48bd24a10a700c4e484c","observation_id":"d60c3f31-2c53-4485-8036-1ed7c73cb0cb","resolution":{"observed_at":"2026-06-30T21:35:04.501725Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-20T18:52:18.85917+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T18:52:18.85917+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T16:53:57.381198Z","title":"Recent LLM agents have made skills a practical interface for storing and composing procedural knowledge in language-conditioned environments","venue":null,"work_id":"ab961969-bd92-4eb5-9bfa-662633984bb5","year":1999},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:22ddeff37052b07ad5609e38448f602f9af60f13817fabbe07d69b105e1d4b98","observation_id":"c528b9a5-e8c8-4dcc-8d27-20012df7a473","resolution":{"observed_at":"2026-07-07T16:53:57.382533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":1,"metadata_mismatch":24,"parse_uncertain":0,"unresolved":0,"verified_exact":13,"verified_fuzzy":2},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 2 inbound Pith citation observations for arXiv:2605.13527."}