{"as_of":"2026-08-18T18:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9bf015870ba266e0254712f76021e20565c96d4ee6e91db215b8ad7b1ed5725c","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:34:31.209389Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T22:08:27.511727Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"cited_work":{"arxiv_id":"2505.12632","doi":"10.48550/arxiv.2505.12632","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12632","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025 , publisher =","venue":"ArXiv.org","work_id":"db0cc8db-091f-4105-8a74-364a0898bb64","year":2025},"citing_paper":{"arxiv_id":"2605.17656","last_updated":"2026-05-17T21:14:32Z","snapshot_observed_at":"2026-08-16T07:04:11.589494Z","submitted_at":"2026-05-17T21:14:32Z","title":"MUIAnno: An Expert-Annotated Dataset and Evaluation Benchmark for Mobile UI Understanding","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-19T22:08:27.511727Z"},"links":{"cited_paper":"/paper/2505.12632","citing_paper":"/paper/2605.17656"},"observation_digest":"sha256:87161225bee401928d437de5fc4fa62c17268ff6f5ff5980c909efabc3cc8b86","observation_id":"bf4e1a33-b013-469c-a735-1001a0f7a02e","resolution":{"observed_at":"2026-05-19T22:12:50.492819Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:15.828376+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:15.828376+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.12632/citation-record","integrity":"/paper/2505.12632/integrity","json":"/paper/2505.12632/citation-record.json","paper":"/paper/2505.12632"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-15T20:34:30.937385Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:30.937385Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:f68522d48e9d03b87a0d788204976197f32ca11475def8b7654c46956ce730f1","observation_id":"c3bbb260-5773-4d5b-9611-8240acda3862","resolution":{"observed_at":"2026-08-15T20:34:30.937385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:32.181003Z","title":"Language Models are Few-Shot Learners","venue":null,"work_id":"f3ca3052-2afc-4ec1-883b-60c7729c9602","year":2020},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:30.942867Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:67699fe498632077a809609e04be9e581ec16f3c23eefe84249428c3b7dcadfe","observation_id":"47143c76-d98f-4db0-9cab-253bf586ec50","resolution":{"observed_at":"2026-08-15T20:34:32.185438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:32.166595Z","title":"PySceneDetect","venue":null,"work_id":"f16aa78a-1e60-4929-85cd-175a4c07ab95","year":2024},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:30.947439Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:4e153f3c0214574757b26241df4b89777809623e864862641582dee8888b5b13","observation_id":"e6d15ea8-4ba8-4b5a-8df3-524e8104bea3","resolution":{"observed_at":"2026-08-15T20:34:32.171303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17490","last_updated":"2025-05-29T02:43:50Z","snapshot_observed_at":"2026-08-18T09:21:02.901770Z","submitted_at":"2024-07-03T17:59:58Z","title":"AMEX: Android Multi-annotation Expo Dataset for Mobile GUI Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17490","snapshot_observed_at":"2026-08-15T20:34:30.952146Z","title":"AMEX: Android Multi-annotation Expo Dataset for Mo- bile GUI Agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:30.952146Z"},"links":{"cited_paper":"/paper/2407.17490","citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:3f2bf0a9a2811340d5d40873a7c67acca4af6948458b86620de09ea7136831bb","observation_id":"b9428f4e-68e4-4473-844d-1f73626edb51","resolution":{"observed_at":"2026-08-15T20:34:30.952146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10819","last_updated":"2025-03-24T11:46:14Z","snapshot_observed_at":"2026-08-17T04:18:10.326641Z","submitted_at":"2024-06-16T06:56:53Z","title":"GUI-World: A Video Benchmark and Dataset for Multimodal GUI-oriented Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10819","snapshot_observed_at":"2026-08-15T20:34:30.956868Z","title":"GUI-WORLD: A Dataset for GUI- oriented Multimodal LLM-based Agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:30.956868Z"},"links":{"cited_paper":"/paper/2406.10819","citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:0f4ae22a2022f4697ae67d5c5cf1fc3d3f5ddbf635933c201a20ff8b27eacef1","observation_id":"2fa8da2d-5128-463f-a342-6cc69520a4e2","resolution":{"observed_at":"2026-08-15T20:34:30.956868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04165","last_updated":"2022-07-09T00:45:05Z","snapshot_observed_at":"2026-08-18T15:26:55.394688Z","submitted_at":"2022-07-09T00:45:05Z","title":"Extracting Replayable Interactions from Videos of Mobile App Usage","version":1},"cited_work":{"arxiv_id":"2207.04165","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.04165","snapshot_observed_at":"2026-08-15T20:34:31.505760Z","title":"Extracting Replayable Interactions from Videos of Mobile App Usage","venue":"cs.HC","work_id":"08aba649-b731-46cd-89f1-3fdb5948ea45","year":2022},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:30.961626Z"},"links":{"cited_paper":"/paper/2207.04165","citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:1244aa833a764b9a3bb789ce72d56d31cf1576fcdab5860f3e4fa4ebbc9a3ac4","observation_id":"a9b444d0-bc96-492d-bc5c-37a29b2bc1dd","resolution":{"observed_at":"2026-08-15T20:34:31.514326Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:32.151479Z","title":"Towards Complete Icon Labeling in Mobile Applications","venue":null,"work_id":"6d503e24-5abb-4942-bd59-93455c81f91b","year":2022},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:30.966842Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:92ac92aa5da21a6e0f76f6368d46df83023c6e31add8bbac72f6a68762914b0f","observation_id":"ae9fde3e-1972-4282-9c3e-f11a3139c613","resolution":{"observed_at":"2026-08-15T20:34:32.156959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:32.137894Z","title":"SeeClick: Har- nessing GUI Grounding for Advanced Visual GUI Agents","venue":null,"work_id":"d86e6975-f858-4b04-bc74-465aacce4b7d","year":2024},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:30.971090Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:92fd30d09ab518bfcc2e61c7a5ad298335029e919ed5ec06f97e979c268ad04a","observation_id":"8866b422-70f0-410d-ba2b-743d01bd7f1e","resolution":{"observed_at":"2026-08-15T20:34:32.142384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:32.123867Z","title":"RICO: A Mobile App Dataset for Building Data-Driven Design Applications","venue":null,"work_id":"c26155e0-fbac-4dac-ba7f-fba555c00a8a","year":2017},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:30.975193Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:f2f7c393df524210b524a82413fd1621fc81019e8e69228dbddc559da58c05df","observation_id":"a9bed4ef-3692-425a-8328-fe3011a294ef","resolution":{"observed_at":"2026-08-15T20:34:32.128396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:32.109883Z","title":"Mind2Web: Towards a Generalist Agent for the Web","venue":null,"work_id":"677ccc4d-09a0-477f-b0d1-528c2f64cf46","year":2023},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:30.979379Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:76ab9d71c1422a62d38008ae1f1b266c0c105736cb0ce3b7bd69964cf5fca6ff","observation_id":"672826e4-306e-4a09-a55e-d9fec43f8f40","resolution":{"observed_at":"2026-08-15T20:34:32.114624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:32.095528Z","title":"Mind2Web: Towards a Generalist Agent for the Web","venue":null,"work_id":"ffded62a-6772-4f60-8ac2-53dd46341659","year":2024},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:30.983624Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:c8202b6b9e2065915a1053fd834468d09206ea7e73ecb86e03cddad585e77065","observation_id":"5910a3d5-ab4a-480c-b894-becc1e7a0f83","resolution":{"observed_at":"2026-08-15T20:34:32.100471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:32.081482Z","title":"BERT: Pre-training of Deep Bidirectional Trans- formers for Language Understanding","venue":null,"work_id":"f09f5b79-c659-4d37-a76b-f08d1da18774","year":2019},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:30.987641Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:4a663476ba2d7fe2a50ec5e8536094074b191c00bf3fe9f5a818b57ca1bc7d83","observation_id":"01cccb08-b52f-41a4-b840-47c7b2f0fbfa","resolution":{"observed_at":"2026-08-15T20:34:32.086061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:32.067234Z","title":"Video2Action: Reducing Human Interactions in Action An- notation of App Tutorial Videos","venue":null,"work_id":"6ed82c69-3e85-4248-9d4e-6d51c9506024","year":2023},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:30.991591Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:c7c131e056858040240b8f253d64c73165430dc90d512fb517913563ba0055c9","observation_id":"7c30bf4e-ab8e-42fb-85f0-46c881a51083","resolution":{"observed_at":"2026-08-15T20:34:32.071674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:32.052986Z","title":"Fouhey, Weicheng Kuo, Alexei A","venue":null,"work_id":"42eed251-24cb-42ad-b063-5b8c42c47f2a","year":2018},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:30.995769Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:4d028ff170a222c86e145074d5591db3c8b7c9948d81ca2440754afc81cc2037","observation_id":"3ba335ad-696f-4dfb-b037-177d98e27e91","resolution":{"observed_at":"2026-08-15T20:34:32.057251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:32.039033Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","venue":null,"work_id":"5693c733-ae0c-48c9-8766-fb663f2a47e4","year":2022},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:30.999994Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:7b82a82997eace356e90780d3df544e8d387215337636d4ca51cfc11885e613e","observation_id":"aeb94124-ebaf-4f76-9cdf-945edf6c070e","resolution":{"observed_at":"2026-08-15T20:34:32.043576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:32.023317Z","title":"Multimodal Subtask Graph Generation from Instructional Videos","venue":null,"work_id":"ab5b22c1-2728-481a-b455-068f4aab36c1","year":2023},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.004451Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:f0fe29c4cf93d163a2ae2e0f70c024455bfae91c069b0040bd57496aeac757ef","observation_id":"10aff24c-431f-4f8b-bc86-cc528b8bdd59","resolution":{"observed_at":"2026-08-15T20:34:32.028471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:32.006808Z","title":"VisualWe- bArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks","venue":null,"work_id":"115acec4-6ed5-4be3-aeae-c6a77750c368","year":2024},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.008652Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:6d1dbf0eecf2597dc093e3f43abe8ed5b79305dc04bd8d60478a3419aeac908e","observation_id":"7aff010f-8889-4186-aa5a-3cc3746942cc","resolution":{"observed_at":"2026-08-15T20:34:32.011385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:31.012778Z","title":"Tree Search for Language Model Agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.012778Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:81223e2fc015a251bdfee3ec07e5dfc610f32927f1973dffdd6a6b3606bc345c","observation_id":"39c489b0-cf32-4e5e-a265-0a1916e2ca04","resolution":{"observed_at":"2026-08-15T20:34:31.012778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:31.991898Z","title":"Benchmarking Mobile Device Control Agents across Diverse Configurations","venue":null,"work_id":"2c645d2d-a50b-4c6f-be75-1d5616f92d21","year":2024},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.017161Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:1466d74f4b48fae21bed2126ccb03cff099a438bca1107f0d2bca44939cc9b43","observation_id":"5db60889-8941-4f09-a6fd-823f9c08d5e4","resolution":{"observed_at":"2026-08-15T20:34:31.996782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:31.978362Z","title":"Binary Codes Capable of Correcting Deletions, Insertions, and Reversals","venue":null,"work_id":"dbb41184-1ad2-4ac0-b228-cb1d1e81a1a3","year":1996},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.021324Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:d0fac7e58d688d0200d4909acb687c182d9db8d8c90a0f96c012f5862141d302","observation_id":"e84e0ed6-0c58-47cc-ae82-0c827aeeb2f4","resolution":{"observed_at":"2026-08-15T20:34:31.983020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03001","last_updated":"2022-06-14T12:00:10Z","snapshot_observed_at":"2026-08-16T16:54:52.743317Z","submitted_at":"2022-06-07T04:33:50Z","title":"PP-OCRv3: More Attempts for the Improvement of Ultra Lightweight OCR System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.03001","snapshot_observed_at":"2026-08-15T20:34:31.025307Z","title":"PP-OCRv3: More Attempts for the Improvement of Ultra Lightweight OCR System","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.025307Z"},"links":{"cited_paper":"/paper/2206.03001","citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:e9b6ae249788cee659e35f2106083fe40e8ba67c26944ebd742f5c8a38455010","observation_id":"06e982d0-e682-4905-8fb5-75c772d7bfd9","resolution":{"observed_at":"2026-08-15T20:34:31.025307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:31.964328Z","title":"On the Effects of Data Scale on UI Control Agents","venue":null,"work_id":"4aea02e7-01a4-4844-b8b4-d0dd7c0c400b","year":2024},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.029797Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:1805411dd6ecc6d325562fe058c4cbd38683aa143505a655d9c408605bb068ca","observation_id":"dd404b4d-d3c1-4269-a1a9-151de8a391da","resolution":{"observed_at":"2026-08-15T20:34:31.968880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:31.950551Z","title":"Mapping Natural Language Instructions to Mo- bile UI Action Sequences","venue":null,"work_id":"649f2f3f-0d1a-4a48-a997-23a263cb5a71","year":2020},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.034035Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:e023f0449e1f24944737f23716fa0a8daa8648b112b4bb35ad51537b24c8cdcb","observation_id":"bf9628ce-406b-485c-89ab-425be8a2c339","resolution":{"observed_at":"2026-08-15T20:34:31.955166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-15T02:35:59.111911Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-15T20:34:31.038069Z","title":"Improved Baselines with Visual Instruction Tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.038069Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:b0d2857a310e411652f0306e1c0886139b738e07275cd76c3ab86194dac36874","observation_id":"207cee73-1079-4796-b7ea-ebf448915b5b","resolution":{"observed_at":"2026-08-15T20:34:31.038069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:31.042385Z","title":"Visual Instruction Tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.042385Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:920159ee02aceb15f00a85455c3c120eb7c9d718df626ab198a6e407c803a4b8","observation_id":"18210096-9fe0-48e4-8a38-3f1115638b95","resolution":{"observed_at":"2026-08-15T20:34:31.042385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:31.925196Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","venue":null,"work_id":"7564a6ad-3eeb-4d72-bf57-62d93487b96a","year":2024},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.046416Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:2cca15e68fd280e623ae116a13aca383606a35b49ee3fc1969cd976e618f34f3","observation_id":"82af6a0f-5bc9-483e-8e25-49bd0ec684a2","resolution":{"observed_at":"2026-08-15T20:34:31.929914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:31.909828Z","title":"Unsupervised Task Graph Generation from Instructional Video Transcripts","venue":null,"work_id":"ae46c4cb-5ac7-46f4-a8df-823a25123a33","year":2023},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.050793Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:13d90f7e496e8683e3b04dce8cff37fd959c9c1aec544418ea4bbc9d40a928c7","observation_id":"7cc8d698-64e9-4ceb-ba0d-3a97d9164222","resolution":{"observed_at":"2026-08-15T20:34:31.915395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00203","last_updated":"2024-08-01T00:00:43Z","snapshot_observed_at":"2026-08-18T08:43:23.976880Z","submitted_at":"2024-08-01T00:00:43Z","title":"OmniParser for Pure Vision Based GUI Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00203","snapshot_observed_at":"2026-08-15T20:34:31.054905Z","title":"OmniParser for Pure Vision Based GUI Agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.054905Z"},"links":{"cited_paper":"/paper/2408.00203","citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:fd804a216c43014ce7e7935ceb304b87c6306da964889d5350876eafec0948e0","observation_id":"5f6cbe26-a727-4bc6-9398-37d7d39f2848","resolution":{"observed_at":"2026-08-15T20:34:31.054905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08172","last_updated":"2019-06-14T05:49:22Z","snapshot_observed_at":"2026-08-18T14:57:44.459315Z","submitted_at":"2019-06-14T05:49:22Z","title":"MediaPipe: A Framework for Building Perception Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08172","snapshot_observed_at":"2026-08-15T20:34:31.059071Z","title":"Me- diaPipe: A Framework for Building Perception Pipelines","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.059071Z"},"links":{"cited_paper":"/paper/1906.08172","citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:e02fedc44cef0f197a339c4e64b923965646ad5b79260535bd6d6f17eddbf186","observation_id":"88ca5661-2803-41fe-bb66-b97c4ebd7563","resolution":{"observed_at":"2026-08-15T20:34:31.059071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:31.894176Z","title":"PEFT: State-of-the-art Parameter-Efficient Fine-Tuning methods","venue":null,"work_id":"85bd9e8b-7a22-409f-9381-3179412e4db0","year":2022},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.063522Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:6a877927ebd87768b6c4925bcb025d0a3dba72dbba327184ede780b344ae8b65","observation_id":"2f6b8041-f2a6-4b51-bc14-77a7dc415de6","resolution":{"observed_at":"2026-08-15T20:34:31.899103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:31.879033Z","title":"Llama-3.2","venue":null,"work_id":"e858f5ea-9e2c-4aaf-b029-ec7e3e722903","year":null},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.067831Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:237ac128f8252b2ae6d5eaf6a5f0049b81ea0350835648564b8b7998b29dcc89","observation_id":"d3605614-6e6b-41d5-a6be-d29218027ca9","resolution":{"observed_at":"2026-08-15T20:34:31.883310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:31.076457Z","title":"HowTo100M: Learning a Text-Video Embedding by Watching Hundred Million Narrated Video Clips","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.076457Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:10ae41267191709dba52791ecb8123ad518b4475da047e76d4626d7bd860c742","observation_id":"42630270-b732-4630-9012-3bdcc184b273","resolution":{"observed_at":"2026-08-15T20:34:31.076457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07945","last_updated":"2024-02-09T02:33:45Z","snapshot_observed_at":"2026-08-16T14:20:01.793685Z","submitted_at":"2024-02-09T02:33:45Z","title":"ScreenAgent: A Vision Language Model-driven Computer Control Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07945","snapshot_observed_at":"2026-08-15T20:34:31.082873Z","title":"ScreenA- gent: A Vision Language Model-driven Computer Control Agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.082873Z"},"links":{"cited_paper":"/paper/2402.07945","citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:9d61c6ecd504df68f68ffa5cf70ebb858bc870b8582b2645a845fedb13e52b98","observation_id":"e26dd40b-0af0-450f-b41b-784aec4ff06e","resolution":{"observed_at":"2026-08-15T20:34:31.082873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T20:34:31.087656Z","title":"Gpt-4 Technical Report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.087656Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:db4450ab5eb1944aed5689333badc7653b02215e73f558c412466986de32191b","observation_id":"9273a977-7ea3-457b-961f-aa1bd3ea87b0","resolution":{"observed_at":"2026-08-15T20:34:31.087656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:31.842747Z","title":"GPT-4V Limitations","venue":null,"work_id":"2ed16c3a-c1a8-4b60-a82e-706ecc9d5a43","year":2023},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.091744Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:47b39acc8d4ed4f2d081100fb795483663c9cd919b9cacf48391193967efcd04","observation_id":"07f5e651-8ee7-415c-be62-262f3f8aa7bf","resolution":{"observed_at":"2026-08-15T20:34:31.846680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:31.829417Z","title":"GPT-3.5 Instruct","venue":null,"work_id":"d0d8b49c-c4e1-46a6-b67c-7b47a5e9c316","year":2023},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.096167Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:146bff84344cc6ca95c4ed5b57df108a460b91e32a39a26eeb997cded063a1dc","observation_id":"96ea536a-4a34-4fdb-953d-5182ba0068f0","resolution":{"observed_at":"2026-08-15T20:34:31.833473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:31.816381Z","title":null,"venue":null,"work_id":"46e7abc5-f34a-484d-ad01-e5cee95d91ea","year":2024},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.100317Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:2f037d1176bc2b6065cf4bf2546da7a08110ad9e088f65fa0368d807c874c47f","observation_id":"615eefb9-52ec-4e6f-97ab-bba73ab7eebc","resolution":{"observed_at":"2026-08-15T20:34:31.820699Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:31.802065Z","title":null,"venue":null,"work_id":"e6a0248a-0684-4744-8cb9-9bf7f8bfc7e7","year":2022},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.104455Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:f6fe240f19f8e6cc711ad828e29beb716f373d1ecdf3833840c78f2b05f15d2a","observation_id":"dbf0c5f1-7a6a-4182-bdf2-0593f285d03c","resolution":{"observed_at":"2026-08-15T20:34:31.806906Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:31.788837Z","title":"Language Models are Unsuper- vised Multitask Learners","venue":null,"work_id":"bca36201-39b3-46b0-88e8-eed777f1ac22","year":2019},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.108586Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:2ecf9bfc4e75d2bee08558ad13f55c99356bd143b98a9689f69ce9b8490561b8","observation_id":"0569f2b7-7bbb-4cf5-ba57-62f401c5024f","resolution":{"observed_at":"2026-08-15T20:34:31.793341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:31.775655Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","venue":null,"work_id":"b2c57ccb-cd4d-4c13-8d93-bda8da3074ca","year":2020},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.112716Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:73dc52fde03ee3986e3425b6c6732727a84c3750ced2918f8480d4a86eb82376","observation_id":"a66f953e-544d-4432-94a5-78c042c5e7a6","resolution":{"observed_at":"2026-08-15T20:34:31.779955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:31.762399Z","title":"AndroidInTheWild: A Large- Scale Dataset For Android Device Control","venue":null,"work_id":"796b64ad-3792-489b-a6af-f989a868ea6d","year":2023},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.116652Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:b7a4ccf941a864411c8391a0f9347d716f9d3efdcb02abb509403e81d2bbf938","observation_id":"ac682efd-848a-4af5-81e8-4c13b30d512f","resolution":{"observed_at":"2026-08-15T20:34:31.766896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:31.749387Z","title":"As- sembly101: A Large-Scale Multi-View Video Dataset for Understanding Procedural Activities","venue":null,"work_id":"6836ba43-32eb-45f9-81a3-8b1d7a098d59","year":2022},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.122462Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:8fad576ed41b72ce389b570a0e5393680d40633d4f11f44f721e573e6f1dd4fd","observation_id":"18819b02-5f54-40e1-9913-f2d0d622fc0f","resolution":{"observed_at":"2026-08-15T20:34:31.753766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:31.736649Z","title":"LUSE: Using LLMs for Unsupervised Step Extraction in Instructional Videos","venue":null,"work_id":"7cc5bad2-6f1a-42d3-9d0b-9443b2676acf","year":2023},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.126655Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:b8927ae3b94fb843884300263a657f6ec1daf6215a1824af0cf724055d700b55","observation_id":"71fe8954-bdc3-4ae1-9283-060fbc7294c7","resolution":{"observed_at":"2026-08-15T20:34:31.740788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:31.723162Z","title":"World of Bits: An Open-Domain Plat- form for Web-Based Agents","venue":null,"work_id":"5654ab39-ab7f-4273-8e21-7569fe67bd28","year":null},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.131003Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:5c59e12aa52f2cf89f61a5fb8019badac3ec611452ab634a71bd954590ad4643","observation_id":"f9b597d0-ae71-451b-9c55-7ae76bac7397","resolution":{"observed_at":"2026-08-15T20:34:31.727913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:31.709209Z","title":"AppBuddy: Learning to Accomplish Tasks in Mobile Apps via Rein- forcement Learning","venue":null,"work_id":"c3b474b5-cb42-4188-9e1c-dc5ae0122da7","year":2021},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.135315Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:b6b480e3c98c4f3e57949b92f4eb686bbd92bb01083393e9a35c472dacec1a88","observation_id":"32122ada-a141-49be-b20a-076554ae151d","resolution":{"observed_at":"2026-08-15T20:34:31.714232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00159","last_updated":"2024-06-06T18:46:40Z","snapshot_observed_at":"2026-08-18T13:13:10.222946Z","submitted_at":"2024-01-31T20:29:50Z","title":"Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00159","snapshot_observed_at":"2026-08-15T20:34:31.139287Z","title":"Peters, Abhilasha Ravichander, Kyle Richard- son, Zejiang Shen, Emma Strubell, Nishant Subramani, Oyvind Tafjord, Pete Walsh, Luke Zettlemoyer, Noah A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.139287Z"},"links":{"cited_paper":"/paper/2402.00159","citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:66c27e9cffb5569cb9f5afde299c9dfb779fd67f020185ab48462053d6299355","observation_id":"c4764dc3-5f1f-453d-9de3-3e157451416d","resolution":{"observed_at":"2026-08-15T20:34:31.139287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:31.695393Z","title":"Towards Better Semantic Understanding of Mobile Interfaces","venue":null,"work_id":"4a6e4370-498c-4689-9338-4f7a099a1cad","year":2022},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.143625Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:fd3b9dc16823c5703197ea9461a054d647cda83ae49a7437c5dfa3749536882e","observation_id":"8d45d109-864a-4199-a216-768b1bacf1a4","resolution":{"observed_at":"2026-08-15T20:34:31.699960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:31.681389Z","title":"COIN: A Large-scale Dataset for Comprehensive Instruc- tional Video Analysis","venue":null,"work_id":"f18f92f4-6114-4d52-9c9e-b55d34398c58","year":2019},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.147600Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:fcbadf5405831e349d5a4b78b04572a8f1e2e30692466cb20aef2d73586b4b89","observation_id":"e6ccb45e-c073-49c1-9d3b-6e4246c82502","resolution":{"observed_at":"2026-08-15T20:34:31.685989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13231","last_updated":"2021-05-27T15:20:14Z","snapshot_observed_at":"2026-08-16T18:21:46.236217Z","submitted_at":"2021-05-27T15:20:14Z","title":"AndroidEnv: A Reinforcement Learning Platform for Android","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13231","snapshot_observed_at":"2026-08-15T20:34:31.151703Z","title":"AndroidEnv: A Reinforce- ment Learning Platform for Android","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.151703Z"},"links":{"cited_paper":"/paper/2105.13231","citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:a3a93fadf85b8250c533ce6f4c04a398159b57526b900596a543cf379b6128d0","observation_id":"2555cedd-9b09-4d7f-9f91-768b035d4ce0","resolution":{"observed_at":"2026-08-15T20:34:31.151703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09605","last_updated":"2025-03-03T18:59:36Z","snapshot_observed_at":"2026-08-13T12:40:26.071591Z","submitted_at":"2024-12-12T18:59:27Z","title":"AgentTrek: Agent Trajectory Synthesis via Guiding Replay with Web Tutorials","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09605","snapshot_observed_at":"2026-08-15T20:34:31.156733Z","title":"Agent- Trek: Agent Trajectory Synthesis via Guiding Replay with Web Tutorials","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.156733Z"},"links":{"cited_paper":"/paper/2412.09605","citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:b98edbaf96ed8a09e538e97eeb435c22519f2050e06e698313b8153cce383e52","observation_id":"c77d4217-ce78-429d-9daa-057ba2aac452","resolution":{"observed_at":"2026-08-15T20:34:31.156733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07562","last_updated":"2023-11-13T18:53:37Z","snapshot_observed_at":"2026-08-16T14:43:41.235284Z","submitted_at":"2023-11-13T18:53:37Z","title":"GPT-4V in Wonderland: Large Multimodal Models for Zero-Shot Smartphone GUI Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07562","snapshot_observed_at":"2026-08-15T20:34:31.160983Z","title":"GPT-4V in Wonderland: Large Multimodal Models for Zero-Shot Smartphone GUI Navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.160983Z"},"links":{"cited_paper":"/paper/2311.07562","citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:e492fec79f02066a97e370063987a34d4415078b193d76dc61b62a84b249c67b","observation_id":"9b74395a-5874-44a0-842e-a066551df80d","resolution":{"observed_at":"2026-08-15T20:34:31.160983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-12T21:25:32.312122Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-15T20:34:31.165416Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.165416Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:ae729a97da37629d9f00e20cf87e4b19046d01bc869ad0a98060be667c693954","observation_id":"b7cce51f-59b0-4af5-825e-03d191d0c125","resolution":{"observed_at":"2026-08-15T20:34:31.165416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08144","last_updated":"2024-06-13T11:51:37Z","snapshot_observed_at":"2026-08-16T15:33:16.357663Z","submitted_at":"2023-05-14T12:31:03Z","title":"Mobile-Env: Building Qualified Evaluation Benchmarks for LLM-GUI Interaction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08144","snapshot_observed_at":"2026-08-15T20:34:31.170030Z","title":"Mobile-Env: Building Qual- 10 ified Evaluation Benchmarks for LLM-GUI Interaction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.170030Z"},"links":{"cited_paper":"/paper/2305.08144","citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:8089db1bd98a887f1a1c025bf3e77e97587a68b0275c2da03710411aa4e429d0","observation_id":"b01155ea-fad4-4881-9082-c2cf165c4a2e","resolution":{"observed_at":"2026-08-15T20:34:31.170030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11436","last_updated":"2024-06-07T04:52:29Z","snapshot_observed_at":"2026-08-16T14:59:03.737515Z","submitted_at":"2023-09-20T16:12:32Z","title":"You Only Look at Screens: Multimodal Chain-of-Action Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11436","snapshot_observed_at":"2026-08-15T20:34:31.174319Z","title":"You Only Look at Screens: Multimodal Chain-of-Action Agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.174319Z"},"links":{"cited_paper":"/paper/2309.11436","citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:8e51b2635c4f46feda7fd344345e3b8f9d752aed0b5720e57d088d4525f8060c","observation_id":"9882fc8e-74a2-4364-bffa-18a23a6b238c","resolution":{"observed_at":"2026-08-15T20:34:31.174319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:31.667791Z","title":"GPT-4V(ision) is a Generalist Web Agent, if Grounded","venue":null,"work_id":"9f29dda1-a6ec-4dbc-aa28-2d06d7762845","year":2024},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.178651Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:ec04f4f9fc0eb96a36babc00af72081fcad0caf93dac6d73a0facf3066ca2663","observation_id":"5cc51e23-ea00-4d34-815c-2aa9687f0b42","resolution":{"observed_at":"2026-08-15T20:34:31.672294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:31.653613Z","title":"WebArena: A Realistic Web Envi- ronment for Building Autonomous Agents","venue":null,"work_id":"57184bdf-4f8a-42c1-92e3-ffbef23697b8","year":2023},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.182731Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:954673c4fd25e8bc84da36aad2296dfd358a5c845fe58baff96e2ffb86bd6b6f","observation_id":"db40d8fb-1f6e-46be-967a-2dda7932d43b","resolution":{"observed_at":"2026-08-15T20:34:31.658387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:31.638897Z","title":"Scalable Video-to-Dataset Generation for Cross- Platform Mobile Agents","venue":null,"work_id":"c29e2587-2366-454f-87b1-25835dd2388a","year":2019},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.186583Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:9210d312717d4bb3e653647c485b71d286342552602610653c4609ce14d90e73","observation_id":"f08218b7-0280-48c7-9145-788ae52841bf","resolution":{"observed_at":"2026-08-15T20:34:31.643559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:31.624367Z","title":"phone screen","venue":null,"work_id":"d58b8077-b44c-43aa-b378-9e73234de069","year":null},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.191310Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:e22694cc90a59abfb799d364c5b7630d5c973d959e990287e260ca4420795dfc","observation_id":"f57f30c8-efaf-4dce-b855-70268d6ef664","resolution":{"observed_at":"2026-08-15T20:34:31.628589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:31.610022Z","title":null,"venue":null,"work_id":"e7ebfa9d-47ff-4de1-be04-5d6c5481683d","year":null},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.196435Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:9a4a0baa02dbab9d1daae67cbf634c55f0265eb218049671c44c6aa807297a31","observation_id":"4c36ea95-6a4f-4712-8ac3-cf648a27b0c1","resolution":{"observed_at":"2026-08-15T20:34:31.614162Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:31.595520Z","title":null,"venue":null,"work_id":"d5a6d220-780d-4e62-9a89-d08f737186ca","year":null},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.200583Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:0d14117072fd2d9818248f800056f922e8c7045118788c344cbb8e2b8ec04e04","observation_id":"24e00717-9b67-436e-83a7-d006cb61fa7e","resolution":{"observed_at":"2026-08-15T20:34:31.599890Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:31.580404Z","title":"File: $image","venue":null,"work_id":"b6cf21ee-57ef-4d35-9e7e-e95c4eefeb7c","year":null},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.204662Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:4a584dc6be65931b102636cb46dce9684f8901e4b3351e732fadf02f3cf2cb4d","observation_id":"0e8063a3-24fc-48bf-a781-a58a04d61781","resolution":{"observed_at":"2026-08-15T20:34:31.585897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:31.566464Z","title":"How to Delete A Direct Message on Twitter","venue":null,"work_id":"e44c49eb-b12b-44a6-ab42-ddf1e165d57f","year":null},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.209389Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:d88a9d1e47ac86422542519a2ae91d8d0c776d9f217862f501acb8e8428d1344","observation_id":"baa988c6-0164-4f17-9f9c-c36ec82ccb14","resolution":{"observed_at":"2026-08-15T20:34:31.571059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:31.864754Z","title":null,"venue":null,"work_id":"98c1ab16-7082-4432-91c6-6c224021dc75","year":null},"citing_paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:31.072148Z"},"links":{"citing_paper":"/paper/2505.12632"},"observation_digest":"sha256:bb50d81f304bb89349349f7d3103145d5636dce9e616c50c7d4eb73436d29669","observation_id":"e0e6916d-732a-45b2-ad0d-5e07f95d69c3","resolution":{"observed_at":"2026-08-15T20:34:31.869693Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.12632","last_updated":"2025-05-19T02:39:03Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T08:43:53.391585Z","submitted_at":"2025-05-19T02:39:03Z","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":1,"verified_fuzzy":38},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 1 inbound Pith citation observation for arXiv:2505.12632."}