{"as_of":"2026-08-07T05:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a2087c1fcd26225e920b75c6a96bcb47c58104aa90daf550f1b270763daed22b","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:27:24.411116Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T14:24:48.938948Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T14:27:24.320785Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"cited_work":{"arxiv_id":"2507.05673","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.05673","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"R-vlm: Region-aware vision language model for precise gui grounding","venue":null,"work_id":"d108dbb4-37e5-440a-bcc1-232249f00fe1","year":2025},"citing_paper":{"arxiv_id":"2605.06664","last_updated":"2026-05-07T17:59:31Z","snapshot_observed_at":"2026-08-03T12:56:28.861273Z","submitted_at":"2026-05-07T17:59:31Z","title":"BAMI: Training-Free Bias Mitigation in GUI Grounding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T12:20:42.718277Z"},"links":{"cited_paper":"/paper/2507.05673","citing_paper":"/paper/2605.06664"},"observation_digest":"sha256:0150ac490eb2a662bb6d4aba7dfde08a67dc26304d19ebfce10fdc89123f4704","observation_id":"53b33f13-a7e0-4af3-b7ba-6800a7abb538","resolution":{"observed_at":"2026-05-11T19:16:10.135986Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"cited_work":{"arxiv_id":"2507.05673","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.05673","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"R-vlm: Region-aware vision language model for precise gui grounding","venue":null,"work_id":"d108dbb4-37e5-440a-bcc1-232249f00fe1","year":2025},"citing_paper":{"arxiv_id":"2605.15542","last_updated":"2026-05-15T02:27:41Z","snapshot_observed_at":"2026-08-01T22:59:27.797060Z","submitted_at":"2026-05-15T02:27:41Z","title":"DRS-GUI: Dynamic Region Search for Training-Free GUI Grounding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-19T14:24:48.938948Z"},"links":{"cited_paper":"/paper/2507.05673","citing_paper":"/paper/2605.15542"},"observation_digest":"sha256:0468ad2b686fc983d65473d0edcc2bdc9a83f90e80d0d17ffc34c78f0b475929","observation_id":"22f79aca-1484-4f11-9baf-260f110ea114","resolution":{"observed_at":"2026-05-19T14:27:24.323399Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.05673/citation-record","integrity":"/paper/2507.05673/integrity","json":"/paper/2507.05673/citation-record.json","paper":"/paper/2507.05673"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T19:27:24.212735Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.212735Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:2936b1fc38b09f9a6a8ce45d400e528be631dcc51a50428ca135bf4ddac0f0aa","observation_id":"b11696a9-f229-41bf-9796-3b06c51ca008","resolution":{"observed_at":"2026-08-06T19:27:24.212735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T19:27:24.218897Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.218897Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:8647eb67f74aabcec08a5c9a035530e5990709151e7dc43f6e0febb0e1de392f","observation_id":"ea599908-8907-4dca-8505-f3669f4b8432","resolution":{"observed_at":"2026-08-06T19:27:24.218897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.224150Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.224150Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:3f69220ac87ad7b58fd25c4b938d4d98b11b39b991d1e2164bf8accd77a9c108","observation_id":"cfb5238d-3181-438e-bf97-f4684832be4a","resolution":{"observed_at":"2026-08-06T19:27:24.224150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:25.046811Z","title":null,"venue":null,"work_id":"5f24ee10-6252-40cc-86b5-3c6c3c1ebfb9","year":2022},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.229639Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:afb62bf6b751f5c75d93a49f6acb0fd7f7092b4087b315ef05fd3ef24b82c809","observation_id":"dda9be68-2083-447e-882c-f602fa44f548","resolution":{"observed_at":"2026-08-06T19:27:25.051971Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:25.028688Z","title":null,"venue":null,"work_id":"597b1698-9ee6-4a61-8740-ce0dd0306709","year":2024},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.235829Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:a0b0c8e18e1d231e28332d286c9069cc460e0741ff1b31b17165cd092fe7f246","observation_id":"735c04a1-b202-45d7-bef8-c182ce1024cc","resolution":{"observed_at":"2026-08-06T19:27:25.034436Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.241420Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.241420Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:34160a195dce7097017f9068633125e1cb47b6e2997223e7b9a6070ea2b0c2b7","observation_id":"feb118dc-d6c3-4f77-8c56-8f42b185b65d","resolution":{"observed_at":"2026-08-06T19:27:24.241420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.997891Z","title":null,"venue":null,"work_id":"72ea6ab3-ed3b-4408-ab1b-60114af1af8d","year":2023},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.247498Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:f33c624c5b191c0f9b0cbda19ff70aebc956b106094d3ed3a53c2db24f156b0a","observation_id":"48cedb75-8d1a-4cb2-a7da-4f1a98d7c6f9","resolution":{"observed_at":"2026-08-06T19:27:25.003225Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13108","last_updated":"2024-01-01T14:26:39Z","snapshot_observed_at":"2026-07-06T17:06:00.378648Z","submitted_at":"2023-12-20T15:28:38Z","title":"ASSISTGUI: Task-Oriented Desktop Graphical User Interface Automation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13108","snapshot_observed_at":"2026-08-06T19:27:24.252097Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.252097Z"},"links":{"cited_paper":"/paper/2312.13108","citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:b7e46a7b84ec8ca684bc1d9f6e406d188752296c0aed82cbd6645dcefdc8aaa6","observation_id":"10b439b8-16b2-47e4-830d-d7e89eae4eb5","resolution":{"observed_at":"2026-08-06T19:27:24.252097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.257232Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.257232Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:5166f59f80c319b9de704773eeb0db62f77dce491c7fa15aa22f9a891ccb1059","observation_id":"35d112e1-37a3-49af-8195-51200545f2d4","resolution":{"observed_at":"2026-08-06T19:27:24.257232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.08083","last_updated":"2015-09-27T15:10:14Z","snapshot_observed_at":"2026-08-06T13:49:06.825657Z","submitted_at":"2015-04-30T05:13:08Z","title":"Fast R-CNN","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.08083","snapshot_observed_at":"2026-08-06T19:27:24.262142Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.262142Z"},"links":{"cited_paper":"/paper/1504.08083","citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:1ecae53d3bc280b08d28ffb2065a68cfcda6cc75d5bc7e4cc71c6b06e60dfec0","observation_id":"75cbf0a1-6094-4e83-887d-ecf61b755617","resolution":{"observed_at":"2026-08-06T19:27:24.262142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.967749Z","title":null,"venue":null,"work_id":"7e01bceb-ca3a-494e-b0a4-b1e1adfdad24","year":2014},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.267199Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:2d3d1529ff199081cc2dd4eb25f18d513eb3f387155326d8c53999b3f10a7112","observation_id":"63c08db3-3a34-4587-9f8c-193de7897f46","resolution":{"observed_at":"2026-08-06T19:27:24.973013Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.951622Z","title":null,"venue":null,"work_id":"d09cab4a-03c1-4eb7-b5da-0b8bd1ac5f80","year":2025},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.272772Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:32521d04e03688357c37be33df22555a84c1fcc79c0cecf63d458c4023fd8696","observation_id":"276b7c5f-f2da-4034-bed4-f0e9e97c2d14","resolution":{"observed_at":"2026-08-06T19:27:24.956555Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.935330Z","title":null,"venue":null,"work_id":"55913454-b99f-4844-ab89-1f05d40a682b","year":2023},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.277902Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:75f92d9ac69a262a10d030b253c47b1d8b202878c76bb94f0fb991537ffc0761","observation_id":"3f9e9c18-4adf-4f68-af3d-cfebe1dce810","resolution":{"observed_at":"2026-08-06T19:27:24.940575Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13919","last_updated":"2024-06-06T18:37:34Z","snapshot_observed_at":"2026-07-06T17:20:11.913242Z","submitted_at":"2024-01-25T03:33:18Z","title":"WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13919","snapshot_observed_at":"2026-08-06T19:27:24.283142Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.283142Z"},"links":{"cited_paper":"/paper/2401.13919","citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:ffee98cbdada7dfd3b5c7ef165e8e5aa3a65af5ea78d2967ce5e49d9bd8a1ce4","observation_id":"6ff302a5-700c-4ddd-a218-2f5bde6350a2","resolution":{"observed_at":"2026-08-06T19:27:24.283142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.918933Z","title":null,"venue":null,"work_id":"f00489e3-12c8-42ef-bfd9-aa8c45da8f63","year":2024},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.288554Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:460f5e5fbb2f846524add56b054a275653876ee505d85678ceac2d3daa197b6a","observation_id":"e2b2a860-7b18-45cb-926e-31bc46cada4a","resolution":{"observed_at":"2026-08-06T19:27:24.923855Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.293943Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.293943Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:10340b723fdf184b3060fb9a8065a4350687f4ea69daf3ac440fa88c19f7e334","observation_id":"c0be1938-6bc9-4572-b06e-cf80fb2b0fc6","resolution":{"observed_at":"2026-08-06T19:27:24.293943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17553","last_updated":"2024-07-21T23:16:13Z","snapshot_observed_at":"2026-07-06T17:36:16.016176Z","submitted_at":"2024-02-27T14:47:53Z","title":"OmniACT: A Dataset and Benchmark for Enabling Multimodal Generalist Autonomous Agents for Desktop and Web","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17553","snapshot_observed_at":"2026-08-06T19:27:24.299572Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.299572Z"},"links":{"cited_paper":"/paper/2402.17553","citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:1f9ff60db39e622b75de58028e20f122dca099d12a6957d4076d2bf0a40cced3","observation_id":"a947842b-a14b-4ed0-8147-35ba94124eb5","resolution":{"observed_at":"2026-08-06T19:27:24.299572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.304727Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.304727Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:d45987f6c49dc3f6b02d2a389333532d86256b0b31448c1944e3b0be432a523a","observation_id":"b219ece9-c2af-4596-adde-93cbe84df7f8","resolution":{"observed_at":"2026-08-06T19:27:24.304727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.878027Z","title":null,"venue":null,"work_id":"b99b6773-4dbc-44fe-9eae-566c0bcd3c70","year":2016},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.309870Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:b8a62babaf3c024f96978191c073a0c7b1dbc45af627d9d73aa3a43b8e94026c","observation_id":"17a058b4-165a-412c-9f3a-041b385c2bde","resolution":{"observed_at":"2026-08-06T19:27:24.883379Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T19:27:24.315672Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.315672Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:c581f33955dc2f933dd32c50d938b425f5bad8d18c96cd4e10bb8f93cf5daf97","observation_id":"fbaa090f-817a-49f3-8b7b-b5c1508350b3","resolution":{"observed_at":"2026-08-06T19:27:24.315672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03432","last_updated":"2023-02-07T12:36:35Z","snapshot_observed_at":"2026-07-06T14:49:15.927337Z","submitted_at":"2023-02-07T12:36:35Z","title":"SimCon Loss with Multiple Views for Text Supervised Semantic Segmentation","version":1},"cited_work":{"arxiv_id":"2302.03432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.03432","snapshot_observed_at":"2026-08-06T19:27:24.524307Z","title":"SimCon Loss with Multiple Views for Text Supervised Semantic Segmentation","venue":"cs.CV","work_id":"cf53dd93-3848-4404-a201-de7ac934c68f","year":2023},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.320886Z"},"links":{"cited_paper":"/paper/2302.03432","citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:dad9af5e884a73376ab42e0d8ab3b1cd257b8deca941ce36efb626f14539ce9f","observation_id":"0c71ca54-07d1-4ae9-9208-bf4ed2964856","resolution":{"observed_at":"2026-08-06T19:27:24.532162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.859561Z","title":null,"venue":null,"work_id":"cbf51473-2060-4b67-bcbb-3f5d6b9b943f","year":2024},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.326696Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:e96c60bfd949972ec8cfb122169326b1bceb90034d5e131976f93f1f291475f4","observation_id":"25748ec8-d0ed-4ec8-90d6-f76e2f8e7a44","resolution":{"observed_at":"2026-08-06T19:27:24.865131Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.840818Z","title":null,"venue":null,"work_id":"7ecd5872-01ad-4775-8919-8171eded4292","year":2016},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.332396Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:a122a4024ac48c38d71aa1b47d729ce1ef341a5306368c9a901a05d4483fd307","observation_id":"e2c4afd2-b22f-4f25-8d06-8bbefc3e5711","resolution":{"observed_at":"2026-08-06T19:27:24.846905Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.822553Z","title":null,"venue":null,"work_id":"c35310cd-f53f-4c0f-8d20-2163e9c70e2a","year":2019},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.337540Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:ed534179e75711f90ec05870200c73da6ca2e7781bc31df0c3d39b64e3e36da9","observation_id":"3a5e9143-37bf-4bbc-9f4e-7179113eb47a","resolution":{"observed_at":"2026-08-06T19:27:24.828189Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.805239Z","title":null,"venue":null,"work_id":"d2fc8031-3734-436b-9e0b-5c94bce778e1","year":2023},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.343146Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:78d6d21a5985b983f765ac764798f1ec853f98cc4a370d4813600d370832b6cb","observation_id":"9d0aa4d6-f452-413e-a072-f397d1aca5bf","resolution":{"observed_at":"2026-08-06T19:27:24.810918Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16044","last_updated":"2025-09-01T02:39:51Z","snapshot_observed_at":"2026-07-06T19:56:17.117739Z","submitted_at":"2024-11-25T02:15:30Z","title":"ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16044","snapshot_observed_at":"2026-08-06T19:27:24.348097Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.348097Z"},"links":{"cited_paper":"/paper/2411.16044","citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:52d91323581bd58b090f3a668e306fd58accb3ebdf36bec4ebae2df560928dd5","observation_id":"c20fc2dd-7c26-493e-86bf-47179cab3c62","resolution":{"observed_at":"2026-08-06T19:27:24.348097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.353074Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.353074Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:86522ecec66e7119932aaf98fed2ded963f43cd69da2d35548eafc3745e3d8e4","observation_id":"9c14735c-94a5-4c62-8db0-a0738b40d152","resolution":{"observed_at":"2026-08-06T19:27:24.353074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.775032Z","title":null,"venue":null,"work_id":"929e2ecd-2ae1-499a-955b-300e919fe669","year":2013},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.358476Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:9e7214e953a55dba9970bfc14d8044f20d718a69f20baaf4041b5ebf42e5ded8","observation_id":"4eb04b6c-2332-4a3f-b2cf-ab92b7ac183d","resolution":{"observed_at":"2026-08-06T19:27:24.781317Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.755665Z","title":null,"venue":null,"work_id":"01a55119-4acb-489b-880e-4fdd310e529d","year":2024},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.364462Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:b92922d3154479583444d5073d5ff211ecb290f243bcea7ce7d4e00e446f6a58","observation_id":"dc832ccf-2fa6-44b3-b3ed-8db6b69a42d4","resolution":{"observed_at":"2026-08-06T19:27:24.761739Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11436","last_updated":"2024-06-07T04:52:29Z","snapshot_observed_at":"2026-07-06T16:21:21.249108Z","submitted_at":"2023-09-20T16:12:32Z","title":"You Only Look at Screens: Multimodal Chain-of-Action Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11436","snapshot_observed_at":"2026-08-06T19:27:24.370000Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.370000Z"},"links":{"cited_paper":"/paper/2309.11436","citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:6044731e5fe0952c1779816d7d186527e8182a878c0fa63c558937fa24521722","observation_id":"83061e98-a732-44e5-8b0d-5b14b60cb24a","resolution":{"observed_at":"2026-08-06T19:27:24.370000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01614","last_updated":"2024-03-12T23:14:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-03T08:33:09Z","title":"GPT-4V(ision) is a Generalist Web Agent, if Grounded","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01614","snapshot_observed_at":"2026-08-06T19:27:24.375110Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.375110Z"},"links":{"cited_paper":"/paper/2401.01614","citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:3bdd599121e7f174651786a4adb7911e545c82fc4d94f98a7a6876a9f56e1450","observation_id":"dcb16118-a6f4-40b0-97c6-cbdcddd5e6d0","resolution":{"observed_at":"2026-08-06T19:27:24.375110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.737887Z","title":null,"venue":null,"work_id":"1b30584e-c9e8-4d9b-a194-4326f0171f31","year":2024},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.379963Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:c2b8acad744e40e3daa8e1ce6f74e3174c612898910849efc5754214bc4026c7","observation_id":"442eedfe-ccec-4258-b0b9-1b30644a7616","resolution":{"observed_at":"2026-08-06T19:27:24.743586Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17918","last_updated":"2025-02-14T08:13:39Z","snapshot_observed_at":"2026-07-06T17:51:28.420385Z","submitted_at":"2024-03-26T17:54:15Z","title":"AgentStudio: A Toolkit for Building General Virtual Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17918","snapshot_observed_at":"2026-08-06T19:27:24.385204Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.385204Z"},"links":{"cited_paper":"/paper/2403.17918","citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:43241d1b116e9882ef2bff9aa6b100e0de8f4c7df3745506aeca41e302d5f225","observation_id":"49cf1bcf-c013-4949-9e04-c522406f976c","resolution":{"observed_at":"2026-08-06T19:27:24.385204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.720420Z","title":null,"venue":null,"work_id":"fa4e8e2e-789f-44dc-9bc9-68c3eb3de58c","year":2024},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.390134Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:7569ebba80e03864c09fbcb799b9fb67543fb11e5e817d7804f7b2324caef338","observation_id":"f1dd36eb-7289-4d88-a64b-1f410fae661a","resolution":{"observed_at":"2026-08-06T19:27:24.725332Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.703003Z","title":null,"venue":null,"work_id":"be35ecee-8a32-410e-bf7c-1ca5f9e203fa","year":2025},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.394991Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:8ef4ca5dbdf654791779fc3d29738a702f4264ef00005fd614636cc2a6dea4de","observation_id":"984713c1-71fd-4899-8621-ea70afe44b03","resolution":{"observed_at":"2026-08-06T19:27:24.708939Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.686577Z","title":null,"venue":null,"work_id":"0aa33b93-4ac6-4bdc-a259-1bf75d44a949","year":2014},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.399973Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:d5420dfd6f192fa530b53264f9cff7be2f7e8c41452604a35fa02d83b2b15bf3","observation_id":"d02d0340-1b12-4b81-aded-69b90d337191","resolution":{"observed_at":"2026-08-06T19:27:24.691713Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.405903Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.405903Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:5337a923c4e9f4cec32feb5a0d47dee1c4c137ee5a85e161c9622ab9b054b470","observation_id":"987e571c-f5c3-4a20-9dbd-d040f008a2cb","resolution":{"observed_at":"2026-08-06T19:27:24.405903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.411116Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.411116Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:28642f5e90ecac83ccfb5e634ba0d071cf1fa739e9e32b7b3724c29184a139ba","observation_id":"09dce4fa-b1d5-4fb6-b51d-ba1a9cf5c44d","resolution":{"observed_at":"2026-08-06T19:27:24.411116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T19:18:07.262745Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 2 inbound Pith citation observations for arXiv:2507.05673."}