{"as_of":"2026-08-08T18:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c82c271d1c94e892989e2f0baa287d85f44df10054ebf64f810951bfe9e34b57","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T00:01:39.867668Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.23373/citation-record","integrity":"/paper/2607.23373/integrity","json":"/paper/2607.23373/citation-record.json","paper":"/paper/2607.23373"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-07-31T00:01:32.624103Z","title":"arXiv preprint arXiv:2509.23661 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:32.624103Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:55bccae8c93d18adeeaa9499a454924231e5d25efd3dacd4ba92039b489b7e36","observation_id":"094bf45c-ea4c-4235-a8c0-cd09ff089442","resolution":{"observed_at":"2026-07-31T00:01:32.624103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:32.725286Z","title":"In: Proceedings of the AAAI Conference on Artificial In- telligence","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:32.725286Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:771211369d1c2d85b2f4657c62dad78b470d9563df77867fff94788d87a51e70","observation_id":"f1d37e2b-ebad-45e0-a7aa-d5dc00248eb2","resolution":{"observed_at":"2026-07-31T00:01:32.725286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-31T00:01:32.858371Z","title":"arXiv preprint arXiv:2511.21631 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:32.858371Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:cf1270d8a0a6fa479a43c0b934633600032f7163ceb76fa83bc0ea71c7714955","observation_id":"965803ed-75c0-4000-891e-cb6e51bad4ff","resolution":{"observed_at":"2026-07-31T00:01:32.858371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-31T00:01:32.922639Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:32.922639Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:904d108d9475e494725f403607e3f1a035662cc11f68a56a77485e9ce2627815","observation_id":"ff630cb5-78ae-4394-97c4-266bfe7f780e","resolution":{"observed_at":"2026-07-31T00:01:32.922639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-07-31T00:01:33.003935Z","title":"arXiv preprint arXiv:2004.05150 (2020)","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:33.003935Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:b86ca127cfdfcf3b47b10a80fa0f5f716133dcb6e31c0bb8fd2704d78e8137f2","observation_id":"07347f26-0010-46dc-a137-c82a5de590c0","resolution":{"observed_at":"2026-07-31T00:01:33.003935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13181","last_updated":"2025-04-28T18:01:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-17T17:59:57Z","title":"Perception Encoder: The best visual embeddings are not at the output of the network","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13181","snapshot_observed_at":"2026-07-31T00:01:33.119140Z","title":"arXiv preprint arXiv:2504.13181 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:33.119140Z"},"links":{"cited_paper":"/paper/2504.13181","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:70f0959abf3c1b408daef582101dcc7f0f2f064335fc63ac856a62e558984043","observation_id":"5be5d2c5-d832-4de9-8fa8-ff1cbf161ede","resolution":{"observed_at":"2026-07-31T00:01:33.119140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:33.171167Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:33.171167Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:f446b47c53d85c663f65bed366703f9e894f5e63f572224f6f66744f80117d2a","observation_id":"d24f56e4-f760-42ae-8421-ae9c615a4d8c","resolution":{"observed_at":"2026-07-31T00:01:33.171167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:33.245005Z","title":"In: The Thirty-ninth Annual Conference on Neural Information Processing Systems (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:33.245005Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:87cc8cb92862ecdb1aff58a3992afbff931904b8dc7647fe1319504aff79b252","observation_id":"5354d74b-5494-41bc-a951-10a73d61707e","resolution":{"observed_at":"2026-07-31T00:01:33.245005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17430","last_updated":"2024-07-29T17:59:28Z","snapshot_observed_at":"2026-07-06T18:20:44.070255Z","submitted_at":"2024-05-27T17:59:56Z","title":"Matryoshka Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17430","snapshot_observed_at":"2026-07-31T00:01:33.328665Z","title":"arXiv preprint arXiv:2405.17430 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:33.328665Z"},"links":{"cited_paper":"/paper/2405.17430","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:46eddd3e7c8bc256aa9f3219aeab35e0b6e512b03a58eed1769240ded773de1f","observation_id":"d659ef2f-90cb-45e5-99d1-923c05e3f84b","resolution":{"observed_at":"2026-07-31T00:01:33.328665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:33.418212Z","title":"In: ICLR (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:33.418212Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:b6a2a993a44cfc6c316f185fb28a843966afe8043d00aac9bdfe57678e75bd62","observation_id":"b80b76b5-a54f-4290-88b2-59a35f89dfad","resolution":{"observed_at":"2026-07-31T00:01:33.418212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:33.516741Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:33.516741Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:62b200d0d3259ead8689192f2acb91a969bb26d0ac5a99eb9d16466e0a943c35","observation_id":"cc0bd62c-9fc6-4c5a-ad42-aaed435e4fd3","resolution":{"observed_at":"2026-07-31T00:01:33.516741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-06T08:05:35.311510Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-07-31T00:01:33.623542Z","title":"arXiv preprint arXiv:1904.10509 (2019)","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:33.623542Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:7d0a210aa3086fd31b8c0e48a6ed6cddb26f20d3446d61cce327c222d34a09ed","observation_id":"f31595c2-338e-4243-870f-03797b5e21e3","resolution":{"observed_at":"2026-07-31T00:01:33.623542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-07-31T00:01:33.718457Z","title":"arXiv preprint arXiv:2402.03766 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:33.718457Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:8d0aca22db6c89e8a84823394fab79a87a833c7bbe91e44d8dd01f7fd8f8d97c","observation_id":"ccfa5a24-c162-4fba-9837-a13979c35d7a","resolution":{"observed_at":"2026-07-31T00:01:33.718457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:33.803370Z","title":"In: Proceedings of the IEEE/CVF International Confer- ence on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:33.803370Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:c906efd89808c7865a570095dbff30cccb2b49b0a8ea07f5e987a7f863c20bbe","observation_id":"966b53dd-de11-41d0-ba08-6fe1fc8d6a5d","resolution":{"observed_at":"2026-07-31T00:01:33.803370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:33.864979Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:33.864979Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:408b3233c22e35c3e0aaac780e854d9ab69941998bb4c09783794ff4675a5418","observation_id":"f8c973fc-007f-411c-ac44-3ca37dce4eef","resolution":{"observed_at":"2026-07-31T00:01:33.864979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:33.911479Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:33.911479Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:af500961a60e70c1f7c960bf05e8e6ba7af78f91c186de234be5fc5e5f94dec1","observation_id":"898f5330-0203-4f9f-8d82-d5b332a18204","resolution":{"observed_at":"2026-07-31T00:01:33.911479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-07-31T00:01:34.050706Z","title":"arXiv preprint arXiv:2010.11929 (2020)","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:34.050706Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:30082f23282ae2d7a47e30e86c7f5d4ca3c826e0da53c58c99f4a21f9e8ac499","observation_id":"304e0e1a-e400-486c-bb2e-85c4149e3d25","resolution":{"observed_at":"2026-07-31T00:01:34.050706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:34.113031Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:34.113031Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:cb71326aabb4f6ba63030f575a0fdf961fd343aa6bc388944efc1d6a3efffb66","observation_id":"8920c283-0f8c-49ef-a77c-6d7068b26b8e","resolution":{"observed_at":"2026-07-31T00:01:34.113031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:34.211569Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:34.211569Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:bb97badcca66eede286d1858ff491884e88baeb5e508606222cd73dbb2c67efb","observation_id":"c3fb02bf-5c23-40ce-91cf-149d5d25eb02","resolution":{"observed_at":"2026-07-31T00:01:34.211569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:34.326764Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:34.326764Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:86225c7acd0a4527e35ff24e7d5eb22eddc9646280238f53cdda4188c75ec7ad","observation_id":"c9262c34-fb72-4534-aed5-7ebca176928d","resolution":{"observed_at":"2026-07-31T00:01:34.326764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19315","last_updated":"2024-06-07T03:39:04Z","snapshot_observed_at":"2026-07-06T18:22:10.094519Z","submitted_at":"2024-05-29T17:39:42Z","title":"Matryoshka Query Transformer for Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19315","snapshot_observed_at":"2026-07-31T00:01:34.400885Z","title":"arXiv preprint arXiv:2405.19315 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:34.400885Z"},"links":{"cited_paper":"/paper/2405.19315","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:41f326478ca8d66416313dce28f80bf88b4c64b504efa7ce0c603b2f92a0ba06","observation_id":"902cb00f-32af-4c09-9427-9dad7aedafb2","resolution":{"observed_at":"2026-07-31T00:01:34.400885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:34.480312Z","title":"In: Proceedings of the IEEE/CVF confer- ence on computer vision and pattern recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:34.480312Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:8bb46969053c360c79f316eb596bd2a8be87f44a65a98dc332634478d66478f7","observation_id":"d6084cd6-9915-4075-8734-7891f403498d","resolution":{"observed_at":"2026-07-31T00:01:34.480312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:34.628057Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:34.628057Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:06fa2187c07a881873910c45351952084a2fe1a3a42ef7e81e826d5fa7c8e605","observation_id":"690679a4-1fea-4ca2-9699-b901c36c8feb","resolution":{"observed_at":"2026-07-31T00:01:34.628057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-07-31T00:01:34.711225Z","title":"arXiv preprint arXiv:2408.03326 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:34.711225Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:b1292bb61b712780e9573016945239d452713f1721ef7892d468148306f08608","observation_id":"e9675575-2c75-4aa4-a505-0b5133cc54cd","resolution":{"observed_at":"2026-07-31T00:01:34.711225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:34.779557Z","title":"In: Proceedings of the 2023 conference on empirical methods in natural language processing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:34.779557Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:a3cd6fa0756b757aeb3b09a6cd10415dc1161fb5aec35640755a96c7c88234f1","observation_id":"e62b6a09-3d5c-40f4-9451-00bf76278783","resolution":{"observed_at":"2026-07-31T00:01:34.779557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:34.854510Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:34.854510Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:4335dd968a9e3f679bae5fa3539b80b15865b9986f81be2b83c4b694a8fbf96a","observation_id":"9313867b-121f-4fb1-8843-5667837e5615","resolution":{"observed_at":"2026-07-31T00:01:34.854510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:34.941159Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:34.941159Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:21abf5a0557079e9066100cbb0f44609d7bb727d7b4b611ad97c282147cb8f4c","observation_id":"bf7eea37-43dc-4d33-9d9d-ab3ab76ff443","resolution":{"observed_at":"2026-07-31T00:01:34.941159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:35.043229Z","title":"Science China Information Sciences67(12), 220102 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:35.043229Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:2657609bd9008e615f21cfa179d977cd9612ab936da77620f1c7205c9b025223","observation_id":"1a5f5f1c-d61b-4d93-ba34-c416777594c5","resolution":{"observed_at":"2026-07-31T00:01:35.043229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:35.188413Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:35.188413Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:c9f215d39e107f387c27707a8788c5f2843971457561702bcd7ba288cb0a64ef","observation_id":"6b5350e6-8f23-4bca-9f1f-b7bb25cca713","resolution":{"observed_at":"2026-07-31T00:01:35.188413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:35.260051Z","title":"Advances in neural information processing systems35, 2507– 2521 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:35.260051Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:4a7ba8a3753f5975728fb1d6b8ce2777e5eb19b503f425bf2365ffc950a5e4a7","observation_id":"dac0d11d-68b8-4d53-a6df-1d698f3ad44e","resolution":{"observed_at":"2026-07-31T00:01:35.260051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:35.361614Z","title":"In: Proceedings of the European conference on computer vision (ECCV)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:35.361614Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:90fea6f1f1815c0957fb5c4e3da623c12bb45f45a773b6b22d3125c072a71e23","observation_id":"518b8411-0511-451d-9c2f-3f7e386c7d83","resolution":{"observed_at":"2026-07-31T00:01:35.361614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05299","last_updated":"2025-04-07T17:58:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T17:58:57Z","title":"SmolVLM: Redefining small and efficient multimodal models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05299","snapshot_observed_at":"2026-07-31T00:01:35.403324Z","title":"arXiv preprint arXiv:2504.05299 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:35.403324Z"},"links":{"cited_paper":"/paper/2504.05299","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:233942f4b2a3b79354c865abc3ecd3a8315464a7eecfa42fcfda9e8eb16c3316","observation_id":"90f639cf-4016-478a-88b1-479bd5ad07ca","resolution":{"observed_at":"2026-07-31T00:01:35.403324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:35.480435Z","title":"In: Findings of the association for computational linguistics: ACL 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:35.480435Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:de61cf45a1bf8bad1a454729deb8a87e7f6a93618c27fe8e5204e9f44b802b68","observation_id":"0e022fb1-b882-4283-aa1d-3587102bf34d","resolution":{"observed_at":"2026-07-31T00:01:35.480435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:35.564805Z","title":"In: Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:35.564805Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:6181b8105cc09af939d0186c387b7bae681c178e9fbc36d4b44393d26aecf2ef","observation_id":"1ef4d817-01bb-415c-b67f-34fc60606b83","resolution":{"observed_at":"2026-07-31T00:01:35.564805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:35.625122Z","title":"In: Proceedings of the IEEE/CVF winter conference on applications of computer vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:35.625122Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:ec4eb4973ed05c1ac08d53d8a1c00cad4470a47551526eb0a6af4888720f2caf","observation_id":"b0d7c3ed-df52-414c-b6dc-69d9332eef8e","resolution":{"observed_at":"2026-07-31T00:01:35.625122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.02680","last_updated":"2022-06-06T15:31:35Z","snapshot_observed_at":"2026-08-03T05:32:57.281028Z","submitted_at":"2022-06-06T15:31:35Z","title":"Separable Self-attention for Mobile Vision Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.02680","snapshot_observed_at":"2026-07-31T00:01:35.791774Z","title":"arXiv preprint arXiv:2206.02680 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:35.791774Z"},"links":{"cited_paper":"/paper/2206.02680","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:f5e595fcd30c988d591a28d23cc59461f7bdc25220faad3d3214dba6ff41cf6b","observation_id":"efdc97a7-c351-4f85-8dea-eaeb47bfb5e6","resolution":{"observed_at":"2026-07-31T00:01:35.791774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:35.933720Z","title":"In: Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:35.933720Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:1f6905609ee8d2f511d07b585e0f785e64b6023ac0589dc9db7a53286e2e2db3","observation_id":"fec8168e-c8aa-4f72-88ff-aadeb31d509b","resolution":{"observed_at":"2026-07-31T00:01:35.933720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-31T00:01:36.053011Z","title":"arXiv preprint arXiv:2304.07193 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:36.053011Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:a207df99707828c6a666af88cd38102700222e2db8119d6a743476eb1799b1d2","observation_id":"392e581b-4f1c-4446-b7fb-56f766bf4b95","resolution":{"observed_at":"2026-07-31T00:01:36.053011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:36.212439Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:36.212439Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:a52afa5aa426331668b74741129b11dd521b58235332b5199e3e321b2f1a38c0","observation_id":"66e7714e-842d-400b-a8c8-389fec46d6ea","resolution":{"observed_at":"2026-07-31T00:01:36.212439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:36.327194Z","title":"Advances in neural information processing sys- tems32(2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:36.327194Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:7db202444a0974c6b47ca5ecde8785a892947e761b5b0d437e7b61c585a2a34c","observation_id":"a9979fba-d67b-4110-9b91-9c616ac07627","resolution":{"observed_at":"2026-07-31T00:01:36.327194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:36.383614Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:36.383614Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:bc14d768c36e291952b204dd1625c1537e777107fe69a3dda05833baff1c35d1","observation_id":"4f957f63-a273-4a61-8e57-1132151a4b4d","resolution":{"observed_at":"2026-07-31T00:01:36.383614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:36.578277Z","title":"In: Proceed- ings of the 26th ACM SIGKDD international conference on knowledge discovery & data mining","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:36.578277Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:98d38f83821856c66c54a8193ddc4b2441b4cd7bcdc553f021474355119f9d2e","observation_id":"ac691506-1418-418f-8642-8f1a39d66ff0","resolution":{"observed_at":"2026-07-31T00:01:36.578277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:36.708581Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:36.708581Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:dc27116f046a956b97a3dac91ca2232df2745c7448364819f7b25b15a2984937","observation_id":"e08d5a83-4b32-47d6-99b5-eb49a7e53b41","resolution":{"observed_at":"2026-07-31T00:01:36.708581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:36.832203Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:36.832203Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:ed567fd24249ba1ee882294220d5243da6bbdd6852d1d53614d7594eadf17c1a","observation_id":"8a8ec369-3840-4719-8f29-940fd50b73b5","resolution":{"observed_at":"2026-07-31T00:01:36.832203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:36.985781Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:36.985781Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:b082ad7eabdfb0ff8460cc277d4e8f7a849dc0563f5485884bb719c89b7f46a4","observation_id":"b761f5b3-a653-4cf2-a64b-2b9000002e1c","resolution":{"observed_at":"2026-07-31T00:01:36.985781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:37.103468Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:37.103468Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:7c4c19646bb5e1ad946295fcb1008452ca6c62734562f098d109a193c98ee299","observation_id":"02974f28-d28a-42dc-84c6-9b21e8e4d729","resolution":{"observed_at":"2026-07-31T00:01:37.103468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:37.255686Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:37.255686Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:d3177d7bd0ce7e8813de4f72188cad54d616639d2b6a8648df263a2c5df2110c","observation_id":"0deded97-91c5-4093-8024-557daf45ee63","resolution":{"observed_at":"2026-07-31T00:01:37.255686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15485","last_updated":"2025-04-07T21:50:58Z","snapshot_observed_at":"2026-08-07T16:51:00.631813Z","submitted_at":"2025-03-19T17:58:57Z","title":"TULIP: Towards Unified Language-Image Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15485","snapshot_observed_at":"2026-07-31T00:01:37.402513Z","title":"arXiv preprint arXiv:2503.15485 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:37.402513Z"},"links":{"cited_paper":"/paper/2503.15485","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:f20432cab06c734777d5f8780ffbf039f40c6372df02c7624d2243e5b969f370","observation_id":"13e07a65-2d5a-469d-bf35-4e99ee468c0e","resolution":{"observed_at":"2026-07-31T00:01:37.402513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.09792","last_updated":"2022-01-24T16:42:56Z","snapshot_observed_at":"2026-08-08T09:08:10.045986Z","submitted_at":"2022-01-24T16:42:56Z","title":"Patches Are All You Need?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.09792","snapshot_observed_at":"2026-07-31T00:01:37.527536Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:37.527536Z"},"links":{"cited_paper":"/paper/2201.09792","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:cbb0e4935c045c0afb5e4af4c6c742647bc98a21af655e84be8339a30c327978","observation_id":"26ef6db0-6940-46be-b7d9-cdf0d43f86c6","resolution":{"observed_at":"2026-07-31T00:01:37.527536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-07-31T00:01:37.632360Z","title":"arXiv preprint arXiv:2502.14786 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:37.632360Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:fb166043d7df6f9c5b1a0fa0920b115ed156d63e0382cd4244c4e023b1b41d48","observation_id":"3d24a58a-acf8-4e8d-b015-bf246446a3bd","resolution":{"observed_at":"2026-07-31T00:01:37.632360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:37.739735Z","title":"Advances in Neural Information Pro- cessing Systems36, 46830–46855 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:37.739735Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:21fec9083751209809142fc55908ee922c04bfd9e136bea56adc1263d974e5bf","observation_id":"7cefa37e-9d15-48fe-97e3-bc8a10b72dc0","resolution":{"observed_at":"2026-07-31T00:01:37.739735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:37.864270Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:37.864270Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:fd92c8aec61d0cafefc2aa40b4737af31f81ef8471fda8938a28980ab12137cd","observation_id":"43709f27-d5ee-443b-98f2-53beaa0abf43","resolution":{"observed_at":"2026-07-31T00:01:37.864270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:37.978165Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:37.978165Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:0e5bd393e366f119fe2edbf41088825c4fa07506a63ac02f5fd263a73223e473","observation_id":"67ecff82-707c-409e-8f91-d081c975443c","resolution":{"observed_at":"2026-07-31T00:01:37.978165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:38.050580Z","title":"Advances in neural information pro- cessing systems30(2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:38.050580Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:e166ddf8a09a926314068c330de37f6e54fe0dedb0504cf7a01bc32316773fb3","observation_id":"4ff79c6b-ed9f-4880-a567-30c7ae0c945c","resolution":{"observed_at":"2026-07-31T00:01:38.050580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14100","last_updated":"2022-12-15T19:21:35Z","snapshot_observed_at":"2026-08-04T09:31:34.784365Z","submitted_at":"2022-05-27T17:03:38Z","title":"GIT: A Generative Image-to-text Transformer for Vision and Language","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14100","snapshot_observed_at":"2026-07-31T00:01:38.158513Z","title":"arXiv preprint arXiv:2205.14100 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:38.158513Z"},"links":{"cited_paper":"/paper/2205.14100","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:ba7f510a30b5e598bbdf70dd4120ccff274f76f9c25b84f3ad5acc40641d1214","observation_id":"f2cf568c-90f1-4973-80d3-e2ad1412f34a","resolution":{"observed_at":"2026-07-31T00:01:38.158513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-07-31T00:01:38.278782Z","title":"arXiv preprint arXiv:2409.12191 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:38.278782Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:820a1ed1abaca56c028f2792d0c6f638ab3ce849bad17fc581a0645fbb5b05db","observation_id":"215009d9-eed3-4b8f-a244-fb2b3fb76d13","resolution":{"observed_at":"2026-07-31T00:01:38.278782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:38.405105Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:38.405105Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:402c1b552d5c94e2c51f989fea8065859b96a937fe1f2fcaf5503133437347a6","observation_id":"9e989e71-289b-4c80-acec-be3ad75f102b","resolution":{"observed_at":"2026-07-31T00:01:38.405105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:38.562942Z","title":"CVPR (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:38.562942Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:d509dc5feb5f4e8278cc29c2818c93c47fd084e8200530e03af4809f480a3dcb","observation_id":"73ff9c81-59b2-4b4f-a334-417a205cd2b2","resolution":{"observed_at":"2026-07-31T00:01:38.562942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:38.737392Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:38.737392Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:43d3836ddc7861bdf4963e2cd5a8d29395755ca6677e1e45d53e4b6b0db90a30","observation_id":"2d6969b0-9ef0-468c-9bac-7297c78604e5","resolution":{"observed_at":"2026-07-31T00:01:38.737392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:38.805471Z","title":"In: The Thirteenth International Conference on Learning Representa- tions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:38.805471Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:c1511dac8bf017fedf2a8dc2c3aa13ea9d994498a77731aa810bd6812e21345c","observation_id":"879cc3ac-12cd-49fd-a0d2-a935d2e7f9d5","resolution":{"observed_at":"2026-07-31T00:01:38.805471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:38.927785Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:38.927785Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:a0b2bfa618c7324362ac8ecc6988c0319380c94b23e2a8fa70e76ecb01211d9f","observation_id":"db39c310-8faf-4e46-bb8d-fd63e5af1d47","resolution":{"observed_at":"2026-07-31T00:01:38.927785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:39.027880Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:39.027880Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:8de720e3b62265ccd1e4eb61515e95bc60b1c96f4f6d1cdace5511d8f52e21fd","observation_id":"982fa184-a23d-49d3-9749-8c5c1ed3f9d4","resolution":{"observed_at":"2026-07-31T00:01:39.027880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:39.145738Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pat- tern recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:39.145738Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:7cdc75224e5239dc441384930335b7b3705283ce3a6a9e838c57b9c47878c333","observation_id":"4a7a6ce6-7135-4398-809d-52fc868c2d20","resolution":{"observed_at":"2026-07-31T00:01:39.145738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:39.208088Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:39.208088Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:45a15b3a9bf8bee2e5530ecc6fcde4fe15fbedc2bca7cabb7b2ceaa909012eb4","observation_id":"ca06b46d-6b45-4976-b46d-6285fe82513a","resolution":{"observed_at":"2026-07-31T00:01:39.208088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:39.326347Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:39.326347Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:bdea12e2bdb46f5b4a2edce476edd5c60c3e0c6d588b2ab2a6f8ab1e3b1367e4","observation_id":"5a712220-6839-4948-a204-d866fc4a2017","resolution":{"observed_at":"2026-07-31T00:01:39.326347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:39.434396Z","title":"arXiv e-prints pp","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:39.434396Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:65a724257eadb84e3988fc514c0d864ca2784204100091f3d1e56e6dd5e89744","observation_id":"62f12636-3703-4b1f-aa19-017e96d3ab07","resolution":{"observed_at":"2026-07-31T00:01:39.434396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:39.532976Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:39.532976Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:328c6e295364301e6bad3b14138e150a5f897179501ebd4995f20da4e9e9632a","observation_id":"399b288d-08f2-4733-8220-7de4df0a0dba","resolution":{"observed_at":"2026-07-31T00:01:39.532976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-31T00:01:39.654463Z","title":"arXiv preprint arXiv:2410.04417 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:39.654463Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:ee4c53464579c5ae0491262d0a255ba1cec17260c1e5ee246e910c1ef1e64ba4","observation_id":"3814d9e8-3e61-434a-a671-c35ad689f654","resolution":{"observed_at":"2026-07-31T00:01:39.654463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-31T00:01:39.738511Z","title":"arXiv preprint arXiv:2306.13394 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:39.738511Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:ab9be426222a124b0d8ee24d0c678ee347330431ce000d85015fefd45bd226fb","observation_id":"f1d4c1ff-9071-4986-8938-1af28d583a6b","resolution":{"observed_at":"2026-07-31T00:01:39.738511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-07-31T00:01:39.867668Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:39.867668Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:dfdbb63a958d97a2c47db60a88f04abeda80dd4077d3d6a118f89a7b49f9aa0b","observation_id":"8fe9eb04-1671-44ed-966d-39493cdc64f6","resolution":{"observed_at":"2026-07-31T00:01:39.867668Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T19:24:47.209452Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":69,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:2607.23373."}