{"as_of":"2026-08-19T07:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4e7df8e5b6c9d3f521e5694e47ac8b15071765d8a8515b4ed1cf4eb84c989015","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T16:31:12.584059Z","state":"measured"},{"denominator":80,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":80,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.22708/citation-record","integrity":"/paper/2607.22708/integrity","json":"/paper/2607.22708/citation-record.json","paper":"/paper/2607.22708"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.163051Z","title":"Flamingo: A Visual Language Model for Few-Shot Learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.163051Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:85051c66a8b55fc966f9cfb498d8d5a2bd19d6d4666ba9077d7f2f9fe30fed99","observation_id":"0c8e6953-5b31-4ac8-b2ad-e0ac40f05df8","resolution":{"observed_at":"2026-08-01T16:31:11.163051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.167784Z","title":"Visual Instruction Tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.167784Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:6b9d7b8e7f32d83d7a14e9274a87c2e365b958453ef6431d502db4e4e606ed6f","observation_id":"d623437d-5790-4aef-a9b7-74a8ebfaa77f","resolution":{"observed_at":"2026-08-01T16:31:11.167784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.172041Z","title":"GPT-4V(ision) System Card","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.172041Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:543a65221f75ee2b675ebd83d4fe5643a1d4c40c77bc651e38a73e83d3b3aad6","observation_id":"2af6481b-f764-47d3-90f7-9022fa122675","resolution":{"observed_at":"2026-08-01T16:31:11.172041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-01T16:31:11.175942Z","title":"Qwen2.5-VL Technical Report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.175942Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:64544f692b79969a48293e4206384a8f5ccffd49a38339d48d96325fb122b9f6","observation_id":"f27a1725-7b9c-4872-bfef-6746455e6b8d","resolution":{"observed_at":"2026-08-01T16:31:11.175942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.18154","last_updated":"2025-09-16T19:41:48Z","snapshot_observed_at":"2026-08-09T11:10:24.301223Z","submitted_at":"2025-09-16T19:41:48Z","title":"MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.18154","snapshot_observed_at":"2026-08-01T16:31:11.180838Z","title":"MiniCPM-V 4.5: Cooking Eﬀicient MLLMs via Architecture, Data, and Training Recipes","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.180838Z"},"links":{"cited_paper":"/paper/2509.18154","citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:089b086b407c2b2971dd1c072545d7194fda038399fabacd87ec0287ad17a7ba","observation_id":"aafdf7b7-e115-4a26-a35a-bc270fd35c4b","resolution":{"observed_at":"2026-08-01T16:31:11.180838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.02770","last_updated":"2026-07-02T21:08:53Z","snapshot_observed_at":"2026-08-18T16:22:37.329414Z","submitted_at":"2026-07-02T21:08:53Z","title":"Gemma 4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.02770","snapshot_observed_at":"2026-08-01T16:31:11.185014Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.185014Z"},"links":{"cited_paper":"/paper/2607.02770","citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:01bc5aade1d6020581e833198289ffd7b92a701c9a512c24c3f3b00055f624a9","observation_id":"2bf44dd0-c283-44b5-8f90-6bbf260720ad","resolution":{"observed_at":"2026-08-01T16:31:11.185014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15804","last_updated":"2026-04-21T03:35:14Z","snapshot_observed_at":"2026-08-14T13:05:43.952056Z","submitted_at":"2026-04-17T08:05:46Z","title":"Qwen3.5-Omni Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15804","snapshot_observed_at":"2026-08-01T16:31:11.189450Z","title":"Qwen3.5-Omni Technical Report","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.189450Z"},"links":{"cited_paper":"/paper/2604.15804","citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:648bd1f0b229bb3660ca480d5f7e871df586355f1d9bd00331f7047705095858","observation_id":"0bcbfa66-c464-45c9-884f-d815ade1a0df","resolution":{"observed_at":"2026-08-01T16:31:11.189450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-01T16:31:11.193467Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.193467Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:343f401d9b9ca9ea003e9d6020aad5489e7590487cf7b4f699cb47a11c53da71","observation_id":"ee3993c5-ccbf-419a-a548-6bb8096c548c","resolution":{"observed_at":"2026-08-01T16:31:11.193467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-16T10:03:03.268538Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-01T16:31:11.196881Z","title":"Generating Long Sequences with Sparse Transformers","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.196881Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:a856f7e02f2e278eab6316a2d08f53383b0a1393ac969894a14407bb0b39e659","observation_id":"fa1b171c-598d-49d2-950b-888644a0a6d8","resolution":{"observed_at":"2026-08-01T16:31:11.196881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.201139Z","title":"GPTQ: Accurate Post-Training 29 Quantization for Generative Pre-Trained Transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.201139Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:730309039ac4bc4e5e24d1bcd4faa4ee798b842f628887470a6a357b0a8e9188","observation_id":"b44023af-e0e9-48df-b140-4de3eddafa76","resolution":{"observed_at":"2026-08-01T16:31:11.201139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.205033Z","title":"A WQ: Activation-Aware Weight Quantization for LLM Compression and Acceleration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.205033Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:809baef804991df22671a3f86c2859bc881698899d71547aa8b973929d9e8039","observation_id":"157f9639-fbd3-4060-a9de-e4038f3cb09b","resolution":{"observed_at":"2026-08-01T16:31:11.205033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.208252Z","title":"SmoothQuant: Accurate and Eﬀicient Post-Training Quantization for Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.208252Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:0e69d7eeb29eb1f73a4498a36aa2d8a068855e4b44e13abe572e8fd41ebe76a2","observation_id":"277d40db-e98c-4a1e-9e62-c75bd536fd96","resolution":{"observed_at":"2026-08-01T16:31:11.208252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T16:31:11.212067Z","title":"Qwen3 Technical Report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.212067Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:a8b3199172c5b62fa86f5cb7b90524ca8ab83de21aa78292522fcb8fc7b9019a","observation_id":"7f5eed63-a1c1-4330-84dc-f15c0dce9e89","resolution":{"observed_at":"2026-08-01T16:31:11.212067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-01T16:31:11.216113Z","title":"Qwen3-VL Technical Report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.216113Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:8d71382c0ca2b38ca4928e82b67681f04b28c7c3fa15b4d3b91c590e1ce01417","observation_id":"67132d55-5d58-40dd-b621-6cd1a598cd11","resolution":{"observed_at":"2026-08-01T16:31:11.216113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.220775Z","title":"LLaV A-UHD: An LMM Perceiving Any Aspect Ratio and High-Resolution Images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.220775Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:299b5f69ac16b3e2fe4b6444e1d22a746956276bd2a9dd75399b9b4522155b2f","observation_id":"13082b73-57a1-48b9-80ca-8342fc4adae6","resolution":{"observed_at":"2026-08-01T16:31:11.220775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.224262Z","title":"Aitken, Rob Bishop, Daniel Rueckert, and Zehan Wang","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.224262Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:db4ff50a392990e40e8fee08f332166ce457ef11ac96c842ef3927b6587ed74d","observation_id":"8a13f7d4-0371-4349-8911-369b685a8351","resolution":{"observed_at":"2026-08-01T16:31:11.224262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.227338Z","title":"Gomez, Łukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.227338Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:321d077cc89911484cfc6e24bb49ada0062d1bc86173fc141e859eda9e723952","observation_id":"a27568de-930e-4054-8503-9238fb08251d","resolution":{"observed_at":"2026-08-01T16:31:11.227338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.230406Z","title":"ICDAR 2019 Robust Reading Challenge on Large-Scale Street View Text with Partial Labeling (LSVT)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.230406Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:14c511283023b192e763e4f8e46d9a3f309fde06c8958d6f1b78be454612ab57","observation_id":"b69c3126-9032-4e9a-82fb-0f4fe6d89e35","resolution":{"observed_at":"2026-08-01T16:31:11.230406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.03526","last_updated":"2018-10-08T15:24:07Z","snapshot_observed_at":"2026-08-14T18:17:55.810811Z","submitted_at":"2018-10-08T15:24:07Z","title":"Seven Problems with the Claims Related to the Hubble Tension in arXiv:1810.02595","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.03526","snapshot_observed_at":"2026-08-01T16:31:11.233576Z","title":"MTWI: A Large Multi-T ype Web Images Dataset for Text Recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.233576Z"},"links":{"cited_paper":"/paper/1810.03526","citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:28e6c572a76c2a8f73397310182cf67998baef5068dbf479ff3a53fa301e05ca","observation_id":"fecceb71-0ec1-44ba-9f81-a2fd983b0ece","resolution":{"observed_at":"2026-08-01T16:31:11.233576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-08-14T22:13:00.450823Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-08-01T16:31:11.237847Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.237847Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:0cd4d72d08cb866a56c5dd78e47ee55380f4c30740753860f5c2a4287f038aaa","observation_id":"aedb5422-ff5a-47ce-84cc-1f9660204bbb","resolution":{"observed_at":"2026-08-01T16:31:11.237847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.242136Z","title":"Synthetic Data for Text Localisation in Natural Images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.242136Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:2c44fc1b3ed1534691fd6e83fec92aecce8c0465a9cb8be014cc359b4d16c3d8","observation_id":"cbf48ff2-8655-48fb-9819-46dc22835696","resolution":{"observed_at":"2026-08-01T16:31:11.242136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.245463Z","title":"Tex- tOCR: Towards Large-Scale End-to-End Reasoning for Arbitrary-Shaped Scene Text","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.245463Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:8b4e73be4a456381bb6f603d2141934a27971a5362d4311922802f297312c1c0","observation_id":"899e6d8b-e429-41b6-94a5-de61369ac4a6","resolution":{"observed_at":"2026-08-01T16:31:11.245463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.249440Z","title":"Jawa- har","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.249440Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:caaedfe6aea5a8439682c79bff865ec5eb146111c98e21df2068593348e232ca","observation_id":"92839a7a-e3be-4c4a-ac1e-0e5462b5b88c","resolution":{"observed_at":"2026-08-01T16:31:11.249440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.253558Z","title":"XFUND: A Benchmark Dataset for Multilingual Visually Rich Form Understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.253558Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:cf3bfd29567655be6688e78618be8e73065f85007c2d78920b6fdcb9eeffaea1","observation_id":"ea94e2c1-710c-4187-a9eb-ddc9b654f1a4","resolution":{"observed_at":"2026-08-01T16:31:11.253558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.256919Z","title":"FUNSD: A Dataset for Form Understanding in Noisy Scanned Documents","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.256919Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:6d8dc97ea8f7d8765b66cb318190170283d811fb6395be5e0db90ac660d5db45","observation_id":"ab0557f8-251c-461b-955f-aadbe7129cdb","resolution":{"observed_at":"2026-08-01T16:31:11.256919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.260891Z","title":"Image-Based Table Recognition: Data, Model, and Evaluation (PubTabNet)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.260891Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:29ab07a3465540a4d299043c56f4901c303ed946c4139b2bc6905a9e7c3227c2","observation_id":"0f45d8ff-9123-4659-91e1-a5216e38cd82","resolution":{"observed_at":"2026-08-01T16:31:11.260891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.14470","last_updated":"2021-03-26T13:46:00Z","snapshot_observed_at":"2026-08-18T21:41:38.743499Z","submitted_at":"2021-03-26T13:46:00Z","title":"Spatial Dual-Modality Graph Reasoning for Key Information Extraction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.14470","snapshot_observed_at":"2026-08-01T16:31:11.264506Z","title":"Spatial Dual- Modality Graph Reasoning for Key Information Extraction (WildReceipt)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.264506Z"},"links":{"cited_paper":"/paper/2103.14470","citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:9017f82591f37495d01d7bd11b6b39c25d93885dc531d84e3f8880ab0862298f","observation_id":"327a0edc-4c53-434a-9e33-80f92e42df3c","resolution":{"observed_at":"2026-08-01T16:31:11.264506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.268002Z","title":"CASIA Online and Offline Chinese Handwriting Databases","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.268002Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:4058879def5e65b5a9dc68606f5eb22c90177fcfec110e9568dab50b4ad82634","observation_id":"a902841d-c1ec-4fe4-a833-ce3415268967","resolution":{"observed_at":"2026-08-01T16:31:11.268002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.272620Z","title":"Synthetic Data and Ar- tificial Neural Networks for Natural Scene Text Recognition.NeurIPS Workshop on Deep Learning, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.272620Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:54378084d08a96b082fc3e7266d12e272b2f66972996404e6d6cb71168a4dc3f","observation_id":"4d2f8b5a-081e-4fd6-bf1a-1ffa9ec29460","resolution":{"observed_at":"2026-08-01T16:31:11.272620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.275617Z","title":"Industry Documents Library WebDataset (IDL-WDS)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.275617Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:40d70fcb203e1b2dd657a6f24bde795c5df0e41349960791c533baf9f79e47da","observation_id":"da5367cf-bb71-4807-b92f-93e9bb264af9","resolution":{"observed_at":"2026-08-01T16:31:11.275617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.279624Z","title":"Towards End-to-End Unified Scene Text Detection and Layout Analysis (HierText)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.279624Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:f55a10b7099c74271769255f4bdb2795f928450d0a60ddbfc45ed1cf1e09fce1","observation_id":"879067f2-dcc1-4eb1-8501-360a96a7c8f2","resolution":{"observed_at":"2026-08-01T16:31:11.279624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.283181Z","title":"SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.283181Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:81fd1815c81c4653a41ce89d74251b48e897f0dd4db4ad2237dd167c1993bcfb","observation_id":"11ae5cf8-52a0-4409-9b95-76b4bb4e1930","resolution":{"observed_at":"2026-08-01T16:31:11.283181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-08-16T10:14:53.516684Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-01T16:31:11.287336Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.287336Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:ca7be4dada5637b50315be49c0015093d6a4acd7fdbd32b0b4b8f4f6842b2c17","observation_id":"db8235ac-0579-45c3-84ea-dcf60d4b40ca","resolution":{"observed_at":"2026-08-01T16:31:11.287336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.291766Z","title":"Wave-UI-25K: A Large-Scale UI Element Dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.291766Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:50423a1b709aa80ee5f7f8ff96df949525b02545ef98d51d2c8bdd97cb76e46b","observation_id":"9cc58260-158e-4a6a-8744-f9783e95a48d","resolution":{"observed_at":"2026-08-01T16:31:11.291766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.294985Z","title":"MobileViews: A Large-Scale Mobile GUI Dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.294985Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:08f34a749b9c50139ea3061163b2b85620c307559e2709fec26be4864a55b9fe","observation_id":"7c0f49e6-6962-4d7e-bd80-d8cc05cf163b","resolution":{"observed_at":"2026-08-01T16:31:11.294985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.298496Z","title":"Screen2Words: Automatic Mobile UI Summarization with Multimodal Learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.298496Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:f99a32eaf25fc869f6f3ea630904ab2268d3f46f1d60f6710ff84bd6d992619c","observation_id":"3a459686-be9a-4794-8612-420a1fd5b8ca","resolution":{"observed_at":"2026-08-01T16:31:11.298496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.302292Z","title":"On the Effects of Data Scale on UI Control Agents (Android Control)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.302292Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:cd26a0ff9656638d1f23f2266c912560755148edcc158b364bc93f48bad2b148","observation_id":"caadc118-e7b5-46a9-a0da-ccd54efd1929","resolution":{"observed_at":"2026-08-01T16:31:11.302292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.306246Z","title":"Android in the Wild: A Large-Scale Dataset for Android Device Control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.306246Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:4713ea2b03dda53b9021885b84dbc3d5165d29bd539cb7964c6602e66bd27fc4","observation_id":"31eca24e-9ca4-40ad-8189-24b81e0d0b25","resolution":{"observed_at":"2026-08-01T16:31:11.306246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17490","last_updated":"2025-05-29T02:43:50Z","snapshot_observed_at":"2026-08-18T09:21:02.901770Z","submitted_at":"2024-07-03T17:59:58Z","title":"AMEX: Android Multi-annotation Expo Dataset for Mobile GUI Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17490","snapshot_observed_at":"2026-08-01T16:31:11.310475Z","title":"AMEX: Android Multi-annotation Expo Dataset for Mobile GUI Agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.310475Z"},"links":{"cited_paper":"/paper/2407.17490","citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:59596b1ced3f9c7519d4520255da8efacc6463072a37e8a75e98c9a32bddd0a1","observation_id":"0309373b-7ffe-41ae-81b0-9fafd6cccf61","resolution":{"observed_at":"2026-08-01T16:31:11.310475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10819","last_updated":"2025-03-24T11:46:14Z","snapshot_observed_at":"2026-08-17T04:18:10.326641Z","submitted_at":"2024-06-16T06:56:53Z","title":"GUI-World: A Video Benchmark and Dataset for Multimodal GUI-oriented Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10819","snapshot_observed_at":"2026-08-01T16:31:11.314255Z","title":"GUIAct: A Large-Scale Dataset for GUI Action Understand- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.314255Z"},"links":{"cited_paper":"/paper/2406.10819","citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:3ae50eac1a521c4731f3828ef7badfb2f4f07f8eb944685b413d37a81e2eb1bf","observation_id":"84927a1b-ee8b-4cec-b087-7535b26a95e1","resolution":{"observed_at":"2026-08-01T16:31:11.314255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14573","last_updated":"2025-04-06T20:37:50Z","snapshot_observed_at":"2026-08-18T16:24:19.448563Z","submitted_at":"2024-05-23T13:48:54Z","title":"AndroidWorld: A Dynamic Benchmarking Environment for Autonomous Agents","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14573","snapshot_observed_at":"2026-08-01T16:31:11.318215Z","title":"AndroidWorld: A Dynamic Benchmarking Environment for Autonomous Agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.318215Z"},"links":{"cited_paper":"/paper/2405.14573","citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:fdd72b6b490a04c9e92259220d7c4366937dc5b9aab208d6b4143e14fa7ed322","observation_id":"a055f88c-85dd-41e8-819e-a927e538c56a","resolution":{"observed_at":"2026-08-01T16:31:11.318215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.08199","last_updated":"2025-02-09T21:09:17Z","snapshot_observed_at":"2026-08-16T16:31:54.069794Z","submitted_at":"2022-09-16T23:49:00Z","title":"ScreenQA: Large-Scale Question-Answer Pairs over Mobile App Screenshots","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.08199","snapshot_observed_at":"2026-08-01T16:31:11.323618Z","title":"ScreenQA: Large-Scale Question-Answer Pairs Over Mobile App Screen- shots","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.323618Z"},"links":{"cited_paper":"/paper/2209.08199","citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:9f16a85c936858958328c9958698e366e23d114b6e4e4ca182581efb9129dc76","observation_id":"91d7a79e-bac6-4579-9f25-5592099b4f2e","resolution":{"observed_at":"2026-08-01T16:31:11.323618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.327302Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.327302Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:327ed1b0ba70662b1e254a7f1a7949f5914d0bcdfb8204151cce102d14ab158e","observation_id":"4a22167c-5dd6-4ea1-874c-24ad3cfcce60","resolution":{"observed_at":"2026-08-01T16:31:11.327302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.330625Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.330625Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:5cf06306a5c89891b8d47d6f2db848df8832cbb6d6fd5c620fcbddd0b0de8f49","observation_id":"87c17104-d164-45ad-90ac-83f3a15bdd4e","resolution":{"observed_at":"2026-08-01T16:31:11.330625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.334261Z","title":"ChineseDocVQA: A Chinese Document Question Answering Benchmark","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.334261Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:8ec33ce038ed6470f1e1f333f1915340b37d8e9124d9c01a876a3dbf6a3efad1","observation_id":"8b3485b4-b37a-4157-9271-d9063f3a375f","resolution":{"observed_at":"2026-08-01T16:31:11.334261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.337528Z","title":"ChartQA: A Bench- mark for Question Answering about Charts with Visual and Logical Reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.337528Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:6826876cb0aa5a253be6e5272f586e15fc823efbb86f6b3ad576a246bdd3ea57","observation_id":"1388f081-3b65-42a1-b04a-a13eab3cebfb","resolution":{"observed_at":"2026-08-01T16:31:11.337528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.340921Z","title":"Towards VQA Models That Can Read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.340921Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:e98cc33112e663da2f3df9068fe0d83ec35fb8ba90050a01c30242aa0ba34696","observation_id":"98814a26-da95-4d5e-9cad-b086e1462dfb","resolution":{"observed_at":"2026-08-01T16:31:11.340921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.343909Z","title":"Jawahar, and Dimosthenis Karatzas","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.343909Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:e084c4b4098c0f8db7ff95c04edb52b2d93926ac2d5ca5f514ab04c915e71ca8","observation_id":"0f1fb5fe-2c2b-4196-83af-2313e2b49f2f","resolution":{"observed_at":"2026-08-01T16:31:11.343909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.347245Z","title":"OCR-VQA: Visual Question Answering by Reading Text in Images","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.347245Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:a9e98f5653685662127a417224600dbe46ce7eae554ac0c5dc3c68078ac6d13a","observation_id":"27d6c8cf-ba30-45ea-8d95-6ea11dd20c54","resolution":{"observed_at":"2026-08-01T16:31:11.347245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.350522Z","title":"Learn to Explain: Multimodal Reasoning via Thought Chains for Science Question Answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.350522Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:715fe5013d2e6b60be0f5d7484400b91f3e25ddd6ebebef80787d722dcfda99f","observation_id":"915c1431-d9cc-4bc1-aebb-41a0e707528d","resolution":{"observed_at":"2026-08-01T16:31:11.350522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.354687Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.354687Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:433ad3b5ae355b7809533cf3af59cb2443290f43359a569907e4f4f7d556f199","observation_id":"88f3e7ec-5781-4205-9046-69f9909e6932","resolution":{"observed_at":"2026-08-01T16:31:11.354687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.358331Z","title":"LAION-5B: An Open Large-Scale Dataset for Training Next Generation Image-Text Models.Advances in Neural Information Processing Systems (NeurIPS), 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.358331Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:1cee4fdab3e85d2da2ba48b5ac78d71b24508763a6010e6d7218ae83add92170","observation_id":"05dfab41-1e55-47cd-8cb4-7b8ea17466e6","resolution":{"observed_at":"2026-08-01T16:31:11.358331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.363826Z","title":"Conceptual 12M: Pushing Web- Scale Image-Text Pre-Training to Recognize Long-Tail Visual Concepts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.363826Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:a981d3606eea7109757c7539fc13e874decd3c6fd7556bbfb62f9449ecd19550","observation_id":"389c4a9a-f7e0-4ff2-9ee5-61702507223e","resolution":{"observed_at":"2026-08-01T16:31:11.363826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.370703Z","title":"Wukong: A 100 Million Large-Scale Chinese Cross-Modal Pre-Training Benchmark","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.370703Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:db10840c00223fa4b4b09defd5b21f7be958bae439b6f9ee2634e960fe18008a","observation_id":"f3a35fbd-f121-478c-91c2-91e5284e213e","resolution":{"observed_at":"2026-08-01T16:31:11.370703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.384859Z","title":"COCO-CN for Cross-Lingual Image Tagging, Captioning, and Retrieval","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.384859Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:a66bc5cf82f84a4296fa5f82bd041ac91f361eb81ecf4459de7baddd5683d201","observation_id":"4a0b70be-8b7d-4f4c-af5e-b43b294917e3","resolution":{"observed_at":"2026-08-01T16:31:11.384859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.399767Z","title":"Flickr30k-CN: Chinese Version of Flickr30k","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.399767Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:c1af74fad2603cb4c80388377e9dcaf26a7df0c7de9b860336ac526c5a7e999a","observation_id":"e3a060c6-b187-420d-8de6-72f705ad4bc9","resolution":{"observed_at":"2026-08-01T16:31:11.399767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-01T16:31:11.411882Z","title":"ALLaV A: Harnessing GPT4V-Synthesized Data for a Lite Vision-Language Model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.411882Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:da7ef15de5be7f93889f15882c9d763232f7919b7fea05b9c368fd92d0546feb","observation_id":"fc030710-7f3d-4c6a-9c50-c2a7651aeed0","resolution":{"observed_at":"2026-08-01T16:31:11.411882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.424454Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.424454Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:a59d00c3b84b0fa79e75e3d966ed8143e1638d6607ff7fc8a2fb34109179ec3a","observation_id":"e6778c1e-0c14-4df5-9266-c6ded23775cc","resolution":{"observed_at":"2026-08-01T16:31:11.424454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.435425Z","title":"ShareGPT-4o: Comprehensive Multimodal Annotations with GPT-4o","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.435425Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:af9f34db5324405408ab17c571f48ad804a0185024a03f7a75ce5337d7a917aa","observation_id":"c751b3c5-70c5-455f-b00a-0cf0302719e4","resolution":{"observed_at":"2026-08-01T16:31:11.435425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-16T15:17:42.537490Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-08-01T16:31:11.447932Z","title":"SVIT: Scaling up Visual Instruction Tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.447932Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:daeea7a96bc572a05ce6d9f25783c81bc38c46825208a6b36b702475c745d730","observation_id":"fe6631cc-985d-41ee-a96b-da517e43bb84","resolution":{"observed_at":"2026-08-01T16:31:11.447932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.460150Z","title":"Learning Transferable Visual Models from Natural Language Supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.460150Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:da6c125f469e8d8486e1d5ab6805deb180a27bb4db50800efa09648f3efe652c","observation_id":"2b61bb21-d93c-4668-9318-9a3bec3ffd8a","resolution":{"observed_at":"2026-08-01T16:31:11.460150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.472649Z","title":"Implementation and Benchmarking of Perceptual Image Hash Functions (pHash)","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.472649Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:3b5ee606bfbc07bb50ef522da06cadd92152a2b0a87f2d1f4cf2ec9aad5a9596","observation_id":"6865b9ac-9130-4815-8cf5-aa5db9f1075f","resolution":{"observed_at":"2026-08-01T16:31:11.472649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.483109Z","title":null,"venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.483109Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:a32b9e0a7b4078c9efc0ca8ea881dbc166fcb17000ac9c207137687e1cc8c667","observation_id":"acf07bab-cb36-4b96-b0da-8e49b912cf2c","resolution":{"observed_at":"2026-08-01T16:31:11.483109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.499913Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.499913Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:8e6d3b726a98c1f1b83122d10a45b020db471cdbb1345f13a7ddca7e71a58dac","observation_id":"fc91d887-15ab-426c-84d0-ec2999ffc4ec","resolution":{"observed_at":"2026-08-01T16:31:11.499913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23218","last_updated":"2024-10-30T17:10:19Z","snapshot_observed_at":"2026-08-18T19:02:31.209289Z","submitted_at":"2024-10-30T17:10:19Z","title":"OS-ATLAS: A Foundation Action Model for Generalist GUI Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23218","snapshot_observed_at":"2026-08-01T16:31:11.517595Z","title":"ScreenSpot-v2: A More Robust Screen UI Grounding Benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.517595Z"},"links":{"cited_paper":"/paper/2410.23218","citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:a12886cbe908fe980dde08e7fd63b475f799aacba3bb496d6b771c7e231b0546","observation_id":"19b876e7-b1ae-4b02-9659-5cc140b6f77a","resolution":{"observed_at":"2026-08-01T16:31:11.517595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T16:31:11.613077Z","title":"Li, and Yu Wu et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.613077Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:1d8257a7f1a70b4233832fb19906c416631c97fd82a55689bf396f956a21ea8b","observation_id":"da69dde2-7265-4a01-898b-666d18034e74","resolution":{"observed_at":"2026-08-01T16:31:11.613077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18254","last_updated":"2025-06-23T02:56:36Z","snapshot_observed_at":"2026-08-17T08:14:26.874860Z","submitted_at":"2025-06-23T02:56:36Z","title":"RLPR: Extrapolating RLVR to General Domains without Verifiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18254","snapshot_observed_at":"2026-08-01T16:31:11.704541Z","title":"RLPR: Extrapolating RL VR to General Domains without Verifiers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.704541Z"},"links":{"cited_paper":"/paper/2506.18254","citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:345e453e707486d6b8838199b5134a82a9935d405aa8961038e2359b8b3e6297","observation_id":"4403b786-7262-4849-adda-33fb400c4398","resolution":{"observed_at":"2026-08-01T16:31:11.704541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.836000Z","title":"RLAIF-V: Open-Source AI Feedback Leads to Super GPT-4V Trustworthiness","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.836000Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:7cf1a6639b608299dd2d75b440573927ef069c138970dd27387e6ca7b82d12e1","observation_id":"d275308a-bed2-4e73-82fa-d76d418983ad","resolution":{"observed_at":"2026-08-01T16:31:11.836000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:11.946959Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.946959Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:ccb523ae27e538064541578d53290a41da519b07dbb59ff7520bbb6e05b47a21","observation_id":"efa52f14-ce52-46e0-98db-3aa2b84f35a5","resolution":{"observed_at":"2026-08-01T16:31:11.946959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:12.001958Z","title":"Zico Kolter, and Zhuang Liu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:12.001958Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:a2fa343cea573061802b732d18e89e3f8b4b962cb2dafe8de7c9d80cb7b75bbc","observation_id":"ddbb1c71-25a5-4db1-a048-2ef1251b8e29","resolution":{"observed_at":"2026-08-01T16:31:12.001958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:12.052313Z","title":"Qualcomm AI Runtime (QAIRT) SDK.https://www.qualcomm.com/ developer/software/qualcomm-ai-engine-direct-sdk , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:12.052313Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:e9c86e758aaa748a1eb898ea94de0ce4da8f0a9649982554878a65718e8cc90a","observation_id":"10b596ba-bdef-4d85-acb3-17fa3d25dca0","resolution":{"observed_at":"2026-08-01T16:31:12.052313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:12.139676Z","title":"Hexagon Tensor Processor (HTP): Qualcomm On-Device AI Accelerator","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:12.139676Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:94241252a9d88dea5a0871a7853fca8dd52e99c9f23bb4cc3ffba80854c169c4","observation_id":"4888ccbf-44c0-4fb9-8df2-0f2e858a6659","resolution":{"observed_at":"2026-08-01T16:31:12.139676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:12.235795Z","title":"Qualcomm Genie: AI Runtime for On-Device Generative Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:12.235795Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:3062752149802fe393deb5fc2fa63b0bfd6abf9481ded39e93a3996e2f315fc5","observation_id":"4dfb00cc-24ce-4a7d-98ac-67cb90c3ea9c","resolution":{"observed_at":"2026-08-01T16:31:12.235795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:12.318022Z","title":"ONNX: Open Neural Network Exchange","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:12.318022Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:9a147dc07b5b60484fe0dc43f99120fb7f12623a02d0b807586eefb9b0f9af59","observation_id":"3bf75391-926e-4235-8cdc-dab1a3c4915c","resolution":{"observed_at":"2026-08-01T16:31:12.318022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-17T12:32:16.575866Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-01T16:31:12.377437Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Eﬀiciency","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:12.377437Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:a6bb487f8d57d1da6cc4d767143af19d4a1463767e3fba4a44d3cb9bd36e47c7","observation_id":"57296692-7d1d-4526-9fb4-4b8dc2b784d4","resolution":{"observed_at":"2026-08-01T16:31:12.377437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:12.430191Z","title":"Paech, Paul Pak, Rom N","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:12.430191Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:4265e48e15d3a76467839d83023a4cf625b2dbd1b7c41417448486d4eddd9b0a","observation_id":"68b888a8-fd2e-4524-8105-30d343422d36","resolution":{"observed_at":"2026-08-01T16:31:12.430191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:12.485226Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:12.485226Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:104a35b5f0f7efd84d3c2340ec91186704524679515e4c63f8af7c1819c9984d","observation_id":"e6c76062-526e-49d9-a39e-f2b276ac32ac","resolution":{"observed_at":"2026-08-01T16:31:12.485226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-12T17:21:52.298102Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-01T16:31:12.518516Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:12.518516Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:eef285a1bddb32ffce1d21342ce99940779bedd772f45b13ce3b6bf72169a2e0","observation_id":"9f6cffe7-2dc7-48dc-89c1-eda5a011adbb","resolution":{"observed_at":"2026-08-01T16:31:12.518516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:12.549423Z","title":"Berg, and Tamara L","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:12.549423Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:ea69ce863a4c770ab86819ab537487b293e7a3dc448ac434956687c8535c7aed","observation_id":"62460a42-b29e-4695-83c3-e89de74c20b4","resolution":{"observed_at":"2026-08-01T16:31:12.549423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:31:12.584059Z","title":"ࠞ”ཟb ശđ໡ᄝ “ࠞת","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:12.584059Z"},"links":{"citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:e995dee205854be0d531e822b5767caeff05b01935c5742bb7f07924c86a10aa","observation_id":"bb25b327-c346-478d-8158-2dc600fbf812","resolution":{"observed_at":"2026-08-01T16:31:12.584059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T09:26:51.273823Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":80,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 0 inbound Pith citation observations for arXiv:2607.22708."}