{"as_of":"2026-08-22T16:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:45acc4ece60a07497071094310ccfbd59cc0464f09d9897406a77d8df2093c39","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:57:24.615262Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:11:55.120740Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05895","snapshot_observed_at":"2026-08-07T14:11:55.120740Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19683","last_updated":"2025-05-26T08:44:53Z","snapshot_observed_at":"2026-08-13T22:06:58.555085Z","submitted_at":"2025-05-26T08:44:53Z","title":"Large Language Models for Planning: A Comprehensive and Systematic Survey","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:55.120740Z"},"links":{"cited_paper":"/paper/2505.05895","citing_paper":"/paper/2505.19683"},"observation_digest":"sha256:a8906ef4e6eed0052e09a59116cc5f90796c5050e7c41a6e75252e6a426faab2","observation_id":"549febca-045c-4126-9865-9366524671b0","resolution":{"observed_at":"2026-08-07T14:11:55.120740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.05895/citation-record","integrity":"/paper/2505.05895/integrity","json":"/paper/2505.05895/citation-record.json","paper":"/paper/2505.05895"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.608303Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"efbf57ca-6392-401d-989d-44ea84f8dac9","year":2022},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.375287Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:9a83e47b7f38713ad632ef382cef5399abaea93aafbf8bfed617d1104d173892","observation_id":"9d14df83-639f-409c-b371-9b1122964a11","resolution":{"observed_at":"2026-08-15T22:57:25.612849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17490","last_updated":"2025-05-29T02:43:50Z","snapshot_observed_at":"2026-08-18T09:21:02.901770Z","submitted_at":"2024-07-03T17:59:58Z","title":"AMEX: Android Multi-annotation Expo Dataset for Mobile GUI Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17490","snapshot_observed_at":"2026-08-15T22:57:24.379811Z","title":"Amex: Android multi-annotation expo dataset for mobile gui agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.379811Z"},"links":{"cited_paper":"/paper/2407.17490","citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:fd5f3e87f92c7c748a9e26ed8275d96a7f7017dc37f6904a60c4a8bf2f591805","observation_id":"f33b714b-ea48-46cd-b218-07e279888710","resolution":{"observed_at":"2026-08-15T22:57:24.379811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.595207Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling, 2025","venue":null,"work_id":"ad4c537f-31be-4e69-a0c8-9e37cc036233","year":2025},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.385323Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:1ccd991f2681400e648796af63fc353569c549b8b46ee8f67cbe5b60519be49b","observation_id":"eca134e8-08b3-4b1d-8931-23c829e30ca2","resolution":{"observed_at":"2026-08-15T22:57:25.599563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10935","last_updated":"2024-02-23T04:36:51Z","snapshot_observed_at":"2026-08-18T02:03:58.046358Z","submitted_at":"2024-01-17T08:10:35Z","title":"SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10935","snapshot_observed_at":"2026-08-15T22:57:24.390797Z","title":"Seeclick: Harnessing gui grounding for advanced visual gui agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.390797Z"},"links":{"cited_paper":"/paper/2401.10935","citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:cbb3036aadd605dc6e0f33b8523c6d2a7d6f8cf6d28bd7b3bd07c41ed4ec0284","observation_id":"cf86736b-96db-4d44-940f-4cb5913c7fc9","resolution":{"observed_at":"2026-08-15T22:57:24.390797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-15T22:57:24.395290Z","title":"S., S ALEHI , M., M UEN - NIGHOFF , N., L O, K., S OLDAINI , L., ET AL","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.395290Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:e5e22c5bfc59f2f7805fbb931f2281b62721f80ce241c124a9a5bc0b18132ca7","observation_id":"254a10d6-d033-44d1-b5e0-c10a68a380b0","resolution":{"observed_at":"2026-08-15T22:57:24.395290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.582564Z","title":"Website screenshots dataset","venue":null,"work_id":"ff16a476-52ca-4f67-b92a-7b55ef34e8d6","year":2022},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.399652Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:316e0105741b2b8ea162d0ff5c770c9eeaf2b45de514338becaead67556d2074","observation_id":"cd92d394-01eb-470c-9524-f15f133cb55c","resolution":{"observed_at":"2026-08-15T22:57:25.586593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.569318Z","title":"Understanding mobile gui: From pixel-words to screen-sentences","venue":null,"work_id":"9d518fbe-7530-4a76-a9c9-40e3ced8105d","year":2024},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.404211Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:aa3b504f8423b8ee9cfe45dbd06436dc6c2ee31ed92177c7df44771a5e0f5a5a","observation_id":"73273d8e-bae7-42cf-a991-88a76ec10e1d","resolution":{"observed_at":"2026-08-15T22:57:25.573820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:24.408687Z","title":"Mobileviews: A large-scale mobile gui dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.408687Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:bdf8f5aab856a92142fc3fb94767a1192a5e37e00204506ecc4de9a565be241a","observation_id":"064b9377-cff7-42d0-a17a-c927b6daa505","resolution":{"observed_at":"2026-08-15T22:57:24.408687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:24.412883Z","title":"Exploring the frontier of vision-language models: A survey of current methodologies and future directions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.412883Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:916f3167a5e4f2c3b8498ff48f7267fa4ab68dab409ba3bd732a27c957803936","observation_id":"a003114e-61d6-458c-8b3c-dde41d8b6a43","resolution":{"observed_at":"2026-08-15T22:57:24.412883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.555552Z","title":"Navi- gating the digital world as humans do: Universal visual grounding for GUI agents","venue":null,"work_id":"7bd2a1f0-7cdc-4ec5-8867-c6f000313915","year":null},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.417207Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:ecf7904fcaf6e772597f89e9efa267dca45589db673864df601c7df8497ecc49","observation_id":"5652d7c6-59b6-4c12-8cac-77ccd8c0cc97","resolution":{"observed_at":"2026-08-15T22:57:25.560154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.542369Z","title":"UGround, Feb","venue":null,"work_id":"3d9eea37-91e4-469f-ae72-dba1f58fa977","year":2025},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.421234Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:d5c083742ffdfae50ff05a2f4c59385037834e69389cd7b14bee4ba7f2e911ef","observation_id":"50030e4d-fece-4685-8af7-e086e24ac74f","resolution":{"observed_at":"2026-08-15T22:57:25.546512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.529249Z","title":"J., S HEN , Y., WALLIS , P., A LLEN -ZHU, Z., L I, Y., WANG , S., W ANG , L., C HEN , W., ET AL","venue":null,"work_id":"70d8a4e4-8e03-4d7a-b6e5-2678c336bcac","year":2022},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.425821Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:b4f63b743a1a0ec5f19e4cc4228d5525ea883bb3b6a1a11a2be34093c633de35","observation_id":"7d3be1ee-c14e-4af1-b875-2eda72894c11","resolution":{"observed_at":"2026-08-15T22:57:25.533392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.514926Z","title":"Ultralytics YOLO, Jan","venue":null,"work_id":"cc2ade51-22b1-4786-ac30-4727d061edbd","year":2023},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.429766Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:b3b0fcfcd97defd871ff27f53553c12c7a5d4541d722ed5c8b86b00b8e8dcee6","observation_id":"ef643501-456b-420f-8926-d2fb645586d6","resolution":{"observed_at":"2026-08-15T22:57:25.519939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.500651Z","title":"E., AND KHAN , F","venue":null,"work_id":"8d12ad12-5695-4306-852f-09573b834e2a","year":2012},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.433768Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:f8ffb8b2bd80a01d9d8d954e7f11693dceca57dcb4aa2e19f91bcb279eb93619","observation_id":"49d19b93-622d-44b3-a238-fddb11759e5a","resolution":{"observed_at":"2026-08-15T22:57:25.505662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.486944Z","title":"Hardware in the loop for automotive vehicle control systems develop- ment","venue":null,"work_id":"75d85fb7-bed1-4f5c-9b5d-2b4e3df5f234","year":2004},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.437419Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:ccb9e82e477a603518ef61cf1393954f4eb0ced94194bd1b57eae590f9c1b8d9","observation_id":"d575d4af-26dd-4e85-b2f5-5f985b430d13","resolution":{"observed_at":"2026-08-15T22:57:25.491417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.473850Z","title":"J., S AXENA , M., AND KUMAR , A","venue":null,"work_id":"315c8d69-881c-4786-b471-960dfaa69843","year":2020},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.442240Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:f4ec00284fe52947f73e11e5f052076fadb063910af8cbbd3d7ea5655c89239a","observation_id":"1e4a718f-5dbb-41c2-8d74-dc129ed72726","resolution":{"observed_at":"2026-08-15T22:57:25.477813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.461547Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"bddc0e1d-07fa-45e3-81f8-f57adc88f73d","year":2023},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.446903Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:64a7c805007fd908199ac5c9f10f9e5e93661a55363edbb2da84c3d29afe65ea","observation_id":"59927e13-07cc-4814-81a2-b96dd379a543","resolution":{"observed_at":"2026-08-15T22:57:25.465765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.449265Z","title":"E., L I, A., R AWLES , C., C AMPBELL -AJALA , F., T YAMAGUNDLU , D., AND RIVA, O","venue":null,"work_id":"cbd77fc2-e465-4bbf-ac82-764ea49f328f","year":2024},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.451200Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:65fe130585fd8cf3f483662c72b15bf3458efd7d8253d4d6f79ab8ba10dc07a7","observation_id":"0c8cbc0f-10f9-40eb-96a8-9e0ad495669b","resolution":{"observed_at":"2026-08-15T22:57:25.453355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02189","last_updated":"2025-04-06T03:12:51Z","snapshot_observed_at":"2026-08-20T17:46:54.459933Z","submitted_at":"2025-01-04T04:59:33Z","title":"A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02189","snapshot_observed_at":"2026-08-15T22:57:24.455088Z","title":"Benchmark evaluations, applications, and challenges of large vision language models: A survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.455088Z"},"links":{"cited_paper":"/paper/2501.02189","citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:f7310b18f78e713da53d5880fcd7a877ff32005b5c129f35785a0c1afb24c534","observation_id":"c5f5653d-de91-4bc9-80e4-d32f723fd76a","resolution":{"observed_at":"2026-08-15T22:57:24.455088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.436502Z","title":"Q., L I, L., G AO, D., Y ANG , Z., W U, S., B AI, Z., L EI, W., W ANG , L., AND SHOU , M","venue":null,"work_id":"715aec05-0a85-48b4-9843-13a6b43ca4d4","year":2024},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.459234Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:5b6746d4b37ca5088e4aa753a167c20b2c7ff6c62553c0df28dfefe45ad807b0","observation_id":"1d7bb569-2222-4796-8648-636a60406375","resolution":{"observed_at":"2026-08-15T22:57:25.440385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.424048Z","title":null,"venue":null,"work_id":"f5c47d90-fa23-45c9-8744-fcc194d5a05c","year":2023},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.462909Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:9657314e8fe16f3c2a6eb2bb3690a24ca145a2b975b8fc3b3451e92254ec6e99","observation_id":"141936cc-6bdf-47af-b05b-1d6ef5434e5b","resolution":{"observed_at":"2026-08-15T22:57:25.428099Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.411007Z","title":"Omniparser for pure vision based gui agent, 2024","venue":null,"work_id":"c02b3da8-7f5c-41f9-8315-9e4d2af8bea9","year":2024},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.467388Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:3b04578b18609e9bd8a24b94ad112df5a89b082952d12128f088ae79939d8e29","observation_id":"6f990c30-9dbe-40dc-9b44-4083fcea05b3","resolution":{"observed_at":"2026-08-15T22:57:25.415345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.397980Z","title":"Automotive User Interfaces: Creating Interactive Experiences in the Car","venue":null,"work_id":"188d202a-8d32-4d4b-a8b2-67c366322721","year":2017},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.472215Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:0857d077a2e4a33e23ad0ce9ffcde77d7650642aa100abbd4ec22fe4f76b98bf","observation_id":"c4cc99a2-aa1b-4767-83fc-16df54f17622","resolution":{"observed_at":"2026-08-15T22:57:25.402301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.384693Z","title":"Functional gui testing of in-vehicle infotainment systems in virtual and real environments","venue":null,"work_id":"3cd86dd2-2192-45b3-bce9-abbb63c6f900","year":2017},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.476063Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:ac486c5af75a15d02e70093f46317ca3d6f4dce702a9878ef11deeb88c87f676","observation_id":"42050c35-10bb-4ced-bec8-09621970f540","resolution":{"observed_at":"2026-08-15T22:57:25.389098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:24.480088Z","title":"Gui agents: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.480088Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:51cb500b82605b528777238768c25b3c687b8d1b9d4ef8b83fa618932a8ce081","observation_id":"0a59b328-85ed-4d0f-a9cf-9a823da3a424","resolution":{"observed_at":"2026-08-15T22:57:24.480088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01613","last_updated":"2025-02-03T22:26:56Z","snapshot_observed_at":"2026-08-21T03:10:22.262998Z","submitted_at":"2024-02-02T18:23:18Z","title":"Nomic Embed: Training a Reproducible Long Context Text Embedder","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01613","snapshot_observed_at":"2026-08-15T22:57:24.484303Z","title":"X., D UDERSTADT , B., AND MULYAR, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.484303Z"},"links":{"cited_paper":"/paper/2402.01613","citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:bf8008d190c9838f65915b1c150d9d1b6f54be4d86a9719e39ba7dcc93caba07","observation_id":"3bf4db7e-b6ac-4d92-98c6-f78d36aceee6","resolution":{"observed_at":"2026-08-15T22:57:24.484303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11871","last_updated":"2025-05-21T06:52:31Z","snapshot_observed_at":"2026-08-20T06:33:09.979073Z","submitted_at":"2024-10-09T12:06:43Z","title":"TinyClick: Single-Turn Agent for Empowering GUI Automation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11871","snapshot_observed_at":"2026-08-15T22:57:24.488711Z","title":"Tinyclick: Single-turn agent for empowering gui automation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.488711Z"},"links":{"cited_paper":"/paper/2410.11871","citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:0bd31827be892a9aadd0ddd42ee7e92178d803ea8830a873c57020ad62d037d6","observation_id":"7c050323-7a8a-4314-8b57-cb775839ca07","resolution":{"observed_at":"2026-08-15T22:57:24.488711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.371005Z","title":"W., H ALLACY , C., R AMESH , A., G OH, G., A GARWAL , S., S ASTRY, G., A SKELL , A., M ISHKIN , P., C LARK , J., ET AL","venue":null,"work_id":"f8664929-ab4f-4262-afcf-45da6aba3c79","year":2021},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.493676Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:b2f0e7f4dd89dc2962531fe772282a7cd8776140327eb9a939a16ba83f3bd145","observation_id":"fd3d2435-190f-4208-8abd-e546b6158353","resolution":{"observed_at":"2026-08-15T22:57:25.375262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.358491Z","title":"Androidinthewild: A large-scale dataset for android device control.Advances in Neural Information Processing Systems 36 (2023), 59708–59728","venue":null,"work_id":"65acc60e-0021-461c-b6a3-e89a63f2bd28","year":2023},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.497775Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:7bff39616cdbab048b0ff41faf2ee1e7d40b203496d4ede613cab98cf88d9e43","observation_id":"891ac202-ed1d-412a-a344-beeb93fccef6","resolution":{"observed_at":"2026-08-15T22:57:25.362714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.345020Z","title":"An overview of the tesseract ocr engine","venue":null,"work_id":"67867609-3997-496a-935c-02d94a44ba25","year":2007},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.501605Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:88d77d68cc44b08e454ac59a3d856be3d46b2ee11d3081384c81544f6d9829eb","observation_id":"3d405db2-88d2-4281-bd39-6147d5ef31dc","resolution":{"observed_at":"2026-08-15T22:57:25.349970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.332363Z","title":"Visualizing data using t-sne","venue":null,"work_id":"fe9d5443-ac54-4d35-aae3-2ac180be08f9","year":2008},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.505552Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:89dd827d5560b29c740e26ec950871d521751dc8f788d2eecc80cbcda8b94598","observation_id":"2e6b6d85-98cb-40f6-9707-a878e44e73a8","resolution":{"observed_at":"2026-08-15T22:57:25.336558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.319662Z","title":"Canoe — hil & sil tools across multiple industries — simulation, 2025","venue":null,"work_id":"242b103e-3c9d-4dfe-9fa2-5db72d8784f5","year":2025},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.509517Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:f49c28e2db7246c1ccb44357537593c876e419a8be6b792aa61b926a9ef7bcc0","observation_id":"7824d42f-9f11-41c9-b848-cd4ae836aac4","resolution":{"observed_at":"2026-08-15T22:57:25.323830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10047","last_updated":"2025-01-13T06:47:21Z","snapshot_observed_at":"2026-08-16T13:43:40.036501Z","submitted_at":"2024-12-13T11:19:56Z","title":"Large Action Models: From Inception to Implementation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10047","snapshot_observed_at":"2026-08-15T22:57:24.513182Z","title":"Large action models: From inception to implementation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.513182Z"},"links":{"cited_paper":"/paper/2412.10047","citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:28ad5e1e340a5052b5e492fdabe4f73eb6d760b6016265d9df5b67c73163cb19","observation_id":"b2b84fae-3894-4006-8ed6-014d8eb2bfb7","resolution":{"observed_at":"2026-08-15T22:57:24.513182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-15T22:57:24.517277Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.517277Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:130e80767867aaeb528f8d89f602c7fd89ab342733b54ed446f8bd96fc6ce1f0","observation_id":"1356ea50-503f-4578-9c93-f7fb9b507162","resolution":{"observed_at":"2026-08-15T22:57:24.517277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04890","last_updated":"2025-02-13T10:09:37Z","snapshot_observed_at":"2026-08-18T09:21:41.196519Z","submitted_at":"2024-11-07T17:28:10Z","title":"GUI Agents with Foundation Models: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04890","snapshot_observed_at":"2026-08-15T22:57:24.521396Z","title":"Gui agents with foundation models: A comprehensive survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.521396Z"},"links":{"cited_paper":"/paper/2411.04890","citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:17bf4b6e17f7d0c1c80f1cc56e764fdc1c0a5595e58c49d8133dfc38ad593e0e","observation_id":"6a8e7663-b871-4744-ad83-accac0b7532b","resolution":{"observed_at":"2026-08-15T22:57:24.521396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.307343Z","title":"Webui: A dataset for enhancing visual ui understanding with web semantics","venue":null,"work_id":"33ee9abd-513c-4e9c-a320-c6504e6140ed","year":2023},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.525480Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:8087167566f31d180bb20259eaded1fa5829919503b7c39a8f0fe937d3bbb4c7","observation_id":"8a327eca-7943-48f5-8b17-0b6ae68557a6","resolution":{"observed_at":"2026-08-15T22:57:25.311324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23218","last_updated":"2024-10-30T17:10:19Z","snapshot_observed_at":"2026-08-19T18:35:24.681471Z","submitted_at":"2024-10-30T17:10:19Z","title":"OS-ATLAS: A Foundation Action Model for Generalist GUI Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23218","snapshot_observed_at":"2026-08-15T22:57:24.529413Z","title":"P., ET AL","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.529413Z"},"links":{"cited_paper":"/paper/2410.23218","citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:1de4397007d8c5ce774b3f469611cabbaabd0f2fea0ca6a8f4ab926b96619d4e","observation_id":"a1bb676c-8f0d-467c-a292-452c979a03b0","resolution":{"observed_at":"2026-08-15T22:57:24.529413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06242","last_updated":"2023-11-10T18:59:08Z","snapshot_observed_at":"2026-08-20T01:13:09.508408Z","submitted_at":"2023-11-10T18:59:08Z","title":"Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.06242","snapshot_observed_at":"2026-08-15T22:57:24.533628Z","title":"Florence-2: Advancing a unified representation for a variety of vision tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.533628Z"},"links":{"cited_paper":"/paper/2311.06242","citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:d43fd19d1b7580e4190a837d17d52faf7f6e17db4fef11829567eb812e2592c2","observation_id":"e063f5eb-1a28-493b-8569-c054c7370469","resolution":{"observed_at":"2026-08-15T22:57:24.533628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-12T21:25:32.312122Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-15T22:57:24.537694Z","title":"Set-of-mark prompting unleashes extraordinary visual grounding in gpt-4v","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.537694Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:4ce6fca77e97f41b2bef873f2090db4cb19d0dd88d254934f47d8859a22fa325","observation_id":"bc089ea0-3488-464b-9acb-831476845143","resolution":{"observed_at":"2026-08-15T22:57:24.537694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.294865Z","title":"Automated testing for automotive infotainment systems","venue":null,"work_id":"cee517b8-9ea3-4c42-b441-8784a90030b3","year":2018},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.542073Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:b4cfc2daa37f200dab1f23d2e3484fa09a167e07d81af13708c65286c525be02","observation_id":"8713b0e4-c0fb-4ad4-af36-0c3804aeafac","resolution":{"observed_at":"2026-08-15T22:57:25.298963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18279","last_updated":"2025-05-06T15:08:00Z","snapshot_observed_at":"2026-08-17T10:40:45.253009Z","submitted_at":"2024-11-27T12:13:39Z","title":"Large Language Model-Brained GUI Agents: A Survey","version":12},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18279","snapshot_observed_at":"2026-08-15T22:57:24.546651Z","title":"Large language model-brained gui agents: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.546651Z"},"links":{"cited_paper":"/paper/2411.18279","citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:d9ec97bc19bbf3f85b035889a75348c779382a4bc3247943cb9ef1704de23f2a","observation_id":"316f154e-1bff-404b-848b-1104a33dc176","resolution":{"observed_at":"2026-08-15T22:57:24.546651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.281432Z","title":"Swift:a scalable lightweight infrastructure for fine-tuning, 2024","venue":null,"work_id":"4e2b6f8c-7f7e-427e-b5ff-343f3653084c","year":2024},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.551580Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:58891f8dac7e0a0abc8936fcb220ecd95b5a4f4f6bdab4e05c038834d2eadd54","observation_id":"4bb2817f-6b9a-4d99-a2c9-e1db882fa6e4","resolution":{"observed_at":"2026-08-15T22:57:25.285806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17918","last_updated":"2025-02-14T08:13:39Z","snapshot_observed_at":"2026-08-19T05:46:03.962201Z","submitted_at":"2024-03-26T17:54:15Z","title":"AgentStudio: A Toolkit for Building General Virtual Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17918","snapshot_observed_at":"2026-08-15T22:57:24.555597Z","title":"\"\"\\ Identify and point to the UI element that corresponds to this test action: {test_action}","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.555597Z"},"links":{"cited_paper":"/paper/2403.17918","citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:3f041f86e285795ae11899c280f98e3250e2384ed00d89282a2ab326609f05db","observation_id":"a7faab3e-e77b-483a-a52e-cdb3a0225788","resolution":{"observed_at":"2026-08-15T22:57:24.555597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.268204Z","title":"select kWh/100mi as electric consumption unit","venue":null,"work_id":"312f5b5f-eb80-45cf-b9de-f75469227641","year":null},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.560091Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:0fb16b2916a2c611a3116ec73337b49962a1910f85f2fc1c40e487e6b9541cfe","observation_id":"19e50659-aa0e-413a-98e4-e6536c6118d1","resolution":{"observed_at":"2026-08-15T22:57:25.272230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.254986Z","title":"Select the burger button","venue":null,"work_id":"2e23476f-f986-4283-96d0-90562b9f4827","year":null},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.564214Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:a6c74914940ac906905bf1b2ed55c5cf3c78fc5fb96a3e6d10d2565969aee2a5","observation_id":"79f6e6aa-a4ed-4cc7-9027-3b1798c1bea1","resolution":{"observed_at":"2026-08-15T22:57:25.258948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.242095Z","title":"turn steering wheel heating on","venue":null,"work_id":"9a838453-5eaf-4e6b-a56f-5bf328d9c954","year":null},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.568395Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:d37cc3824728ac97ee3f2e747894761cd2adc608f537d86240cc6508e1649aea","observation_id":"fb593c0d-44ef-47a5-9fcd-a3089802b73f","resolution":{"observed_at":"2026-08-15T22:57:25.246411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.229129Z","title":"deactivate the reminder signal for mobile phone","venue":null,"work_id":"1ca1d50d-27c5-42f6-82c3-f249978f57aa","year":null},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.572491Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:105eb995e43c8919b1508e17ccab05c3d668290c5041b54c4ef14dde97a40675","observation_id":"383b230e-793e-4ca7-9dc2-b97cffc3cacf","resolution":{"observed_at":"2026-08-15T22:57:25.233341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.216569Z","title":"add phone to Favourites","venue":null,"work_id":"29e38c8c-17f7-437a-8173-4f00601ec523","year":null},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.576584Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:50443eb9b17badbad00344c14ef51bc13d5e26e2d0d27e6f300d7b1dc5f56d09","observation_id":"6741ee9b-956b-457f-89a2-636e24df5470","resolution":{"observed_at":"2026-08-15T22:57:25.220457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.203199Z","title":"increase the right temperature setting with the plus button","venue":null,"work_id":"72981a00-b5e7-4b7a-ac6f-7c3bae5c4108","year":null},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.581292Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:7795246253930c3f0c212d216a40804ef0a595a62736e19e373511ddd6a96635","observation_id":"67d14532-d8d6-4d6d-8897-c105c9b97678","resolution":{"observed_at":"2026-08-15T22:57:25.207197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.190613Z","title":"Activate the first weekly item from the charging list","venue":null,"work_id":"b68dd6fd-da24-4649-82a3-8629a260b3e2","year":null},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.586345Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:b0c5835032e72976dc79015261f26593d23f892d92f8b7ec4dce46f7b107715f","observation_id":"05d56554-e46f-4915-b751-13a23459bd0d","resolution":{"observed_at":"2026-08-15T22:57:25.194787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.177981Z","title":"Go to main menu","venue":null,"work_id":"ac3f369d-9f48-46e1-98cb-c48c215de808","year":null},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.590507Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:6019ee5416512ed45c604e3a0c434a6379d949663685b8a59a10a1e5e1a10b7a","observation_id":"0b96107b-8705-4c59-8156-8031ff2d3fc6","resolution":{"observed_at":"2026-08-15T22:57:25.182094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.163693Z","title":"Audio quality is set to low","venue":null,"work_id":"20149392-189e-4001-88e0-ca6e534c236e","year":null},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.594659Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:0445d3d385d351a60512ccb030f884d19ade6a2a5181f0be45a267a867efa8e9","observation_id":"47362b38-3962-4802-9a5e-c717ad857756","resolution":{"observed_at":"2026-08-15T22:57:25.168527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.150073Z","title":"Sound settings are displayed","venue":null,"work_id":"ee6a67df-52e9-4dc0-813a-61517c6ecf08","year":null},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.599483Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:70f3b0fcb8faa7355f361b4d3cd486767218487ebe1490723757792870d07cd1","observation_id":"2848ad3f-b212-41a6-9e28-49047c0ed883","resolution":{"observed_at":"2026-08-15T22:57:25.154134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.136852Z","title":"Driver assistance options are dis- played","venue":null,"work_id":"608f4a26-a16f-4526-9872-97102ae204c2","year":null},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.603547Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:be1c3d171a89b2790817a8c036a0ce815ee9ef6b1a878369c9fe21e45a1d7828","observation_id":"cc305e1a-d7da-4105-a9f7-3e3bd3191ec9","resolution":{"observed_at":"2026-08-15T22:57:25.141374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.123321Z","title":"The medium sensitivity of the distance control was se- lected","venue":null,"work_id":"85810177-066f-41dd-a856-c67c519c0ac5","year":null},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.607390Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:7cf16fb323c9dbc0c56ded5b453c6164c490f4d79ed49e4cde14a8cbf470484c","observation_id":"d77b9c8e-8757-4382-871b-b56293aedd8e","resolution":{"observed_at":"2026-08-15T22:57:25.128237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.110410Z","title":"Noise reduction is disabled","venue":null,"work_id":"afaf14c8-6e07-43a7-b295-97756baf273e","year":null},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.611357Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:5e8008cbfb649d105481d690d5931327ff6a721e6d52dd0edcbb2a640b8b2500","observation_id":"001d0416-cc4e-47d2-bf21-e9ee5f468803","resolution":{"observed_at":"2026-08-15T22:57:25.114654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:57:25.096266Z","title":"E-Call settings are shown","venue":null,"work_id":"0073d71a-c27a-49bf-8a3b-f82e207dc95a","year":null},"citing_paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T22:57:24.615262Z"},"links":{"citing_paper":"/paper/2505.05895"},"observation_digest":"sha256:b69642f4c6fb3ac7539923b96e087c006f8f2440d14294f882ea5b8c71a2cf8a","observation_id":"976708f6-9228-49ab-b482-cbea7688d00e","resolution":{"observed_at":"2026-08-15T22:57:25.101192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.05895","last_updated":"2025-08-05T16:23:24Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T15:20:30.214066Z","submitted_at":"2025-05-09T09:01:52Z","title":"Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":39},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 1 inbound Pith citation observation for arXiv:2505.05895."}