{"as_of":"2026-08-06T13:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c955bae1bf8a1c40e9f3bce8992ac4a116c6dd9b8216b13138804073ec07c3ff","coverage":[{"denominator":133,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T16:35:37.937462Z","state":"measured"},{"denominator":142,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":142,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":42,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:22:44.438590Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":11,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":"2312.16886","doi":"10.48550/arxiv.2312.16886","metadata_source":"pith","pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","venue":"cs.CV","work_id":"ef2b3279-e78f-44b7-abab-ed7d011dc1cf","year":2023},"citing_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-16T02:56:41.658658Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2306.13549"},"observation_digest":"sha256:60fb6d66eda650a53dd59b8e3d5ec812d4a23584018e0362a499115062fe4a66","observation_id":"bdf9622f-563f-4b8a-9dc3-0b14dbe032d9","resolution":{"observed_at":"2026-05-16T16:35:38.347525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":"2312.16886","doi":"10.48550/arxiv.2312.16886","metadata_source":"pith","pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","venue":"cs.CV","work_id":"ef2b3279-e78f-44b7-abab-ed7d011dc1cf","year":2023},"citing_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T02:33:30.143907Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2401.15947"},"observation_digest":"sha256:c5ddcc865a4d91906f0baa2f501b099e39f0d162d4af03b3160197a24208d268","observation_id":"4077098a-09da-4095-91e3-8d1f95e1a3b0","resolution":{"observed_at":"2026-05-16T16:35:38.347525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":"2312.16886","doi":"10.48550/arxiv.2312.16886","metadata_source":"pith","pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","venue":"cs.CV","work_id":"ef2b3279-e78f-44b7-abab-ed7d011dc1cf","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:27429e9b5645f4985758898c83ee872203bef859644b3678777f849a0712bf56","observation_id":"b230a10c-ff3d-4239-9288-978f8af0d072","resolution":{"observed_at":"2026-05-18T15:27:51.932747Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":"2312.16886","doi":"10.48550/arxiv.2312.16886","metadata_source":"pith","pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","venue":"cs.CV","work_id":"ef2b3279-e78f-44b7-abab-ed7d011dc1cf","year":2023},"citing_paper":{"arxiv_id":"2402.12289","last_updated":"2024-06-25T17:55:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-19T17:04:04Z","title":"DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models","version":5},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-12T19:22:35.305220Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2402.12289"},"observation_digest":"sha256:55baea7a2afc4a28a1b99f39dd6380192918eb68cd4e8b216c67e2669c2f43f9","observation_id":"fa213eda-b313-43d2-b670-e8f7361ca41b","resolution":{"observed_at":"2026-05-16T16:35:38.347525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":"2312.16886","doi":"10.48550/arxiv.2312.16886","metadata_source":"pith","pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","venue":"cs.CV","work_id":"ef2b3279-e78f-44b7-abab-ed7d011dc1cf","year":2023},"citing_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T04:09:36.019146Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2403.09611"},"observation_digest":"sha256:35018c9f57a6b88a626716231a30ef78f9de727764b8985a9c7d58a866811211","observation_id":"a6f2d595-4bbe-4f80-8f1a-d7393d254b97","resolution":{"observed_at":"2026-05-16T16:35:38.347525Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":"2312.16886","doi":"10.48550/arxiv.2312.16886","metadata_source":"pith","pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","venue":"cs.CV","work_id":"ef2b3279-e78f-44b7-abab-ed7d011dc1cf","year":2023},"citing_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-17T07:44:47.355960Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2403.18814"},"observation_digest":"sha256:edf027149f4fcb470273dfd695a013831bb767d52500135bb2378ccc6959f472","observation_id":"9f623020-5c28-4b1f-bd92-0ba607bd4a3c","resolution":{"observed_at":"2026-05-17T07:44:47.522081Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":"2312.16886","doi":"10.48550/arxiv.2312.16886","metadata_source":"pith","pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","venue":"cs.CV","work_id":"ef2b3279-e78f-44b7-abab-ed7d011dc1cf","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:91d4d3ed24fa09743ddf8af3537c6d50da931549374fb793191d528f41b82505","observation_id":"2d8e3930-b40b-40cc-8a51-14a1528b2da5","resolution":{"observed_at":"2026-05-16T16:35:38.347525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":"2312.16886","doi":"10.48550/arxiv.2312.16886","metadata_source":"pith","pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","venue":"cs.CV","work_id":"ef2b3279-e78f-44b7-abab-ed7d011dc1cf","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:a02b3014c526c084af5fd0e6d4d00ddc3e436f54e2f4158333e68cdc2f991dbf","observation_id":"609ae3d3-49e1-4bf3-95bc-b2c8c79df22a","resolution":{"observed_at":"2026-05-16T16:35:38.347525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":"2312.16886","doi":"10.48550/arxiv.2312.16886","metadata_source":"pith","pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","venue":"cs.CV","work_id":"ef2b3279-e78f-44b7-abab-ed7d011dc1cf","year":2023},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:669ec69405352c4ead659276a394509f011bdd2217277322f38c19bab7622c8c","observation_id":"3a7116c2-28ef-48f8-b48b-af9dfecf4bad","resolution":{"observed_at":"2026-05-16T16:35:38.347525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":"2312.16886","doi":"10.48550/arxiv.2312.16886","metadata_source":"pith","pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","venue":"cs.CV","work_id":"ef2b3279-e78f-44b7-abab-ed7d011dc1cf","year":2023},"citing_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T22:09:16.001309Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2410.13848"},"observation_digest":"sha256:84be21cef162e4f138f9cd365bb839080a5eac916a906bafacb55cdf63dc26f0","observation_id":"e24af0d0-3eff-4685-b204-4cc8bd709287","resolution":{"observed_at":"2026-05-16T16:35:38.347525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":"2312.16886","doi":"10.48550/arxiv.2312.16886","metadata_source":"pith","pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","venue":"cs.CV","work_id":"ef2b3279-e78f-44b7-abab-ed7d011dc1cf","year":2023},"citing_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-11T08:14:52.890145Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2501.17811"},"observation_digest":"sha256:938d786dcb544b6af2c97d5af097421f59f281853d9df7ec2288ae2ccb7d05f9","observation_id":"75d58e03-1e58-44ab-838a-c5e00e0f2415","resolution":{"observed_at":"2026-05-16T16:35:38.347525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-06T13:22:44.438590Z","title":"arXiv preprint arXiv:2312.16886 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20749","last_updated":"2025-07-28T11:57:52Z","snapshot_observed_at":"2026-08-06T13:22:43.150297Z","submitted_at":"2025-07-28T11:57:52Z","title":"Investigating Structural Pruning and Recovery Techniques for Compressing Multimodal Large Language Models: An Empirical Study","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T13:22:44.438590Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2507.20749"},"observation_digest":"sha256:99a747f646eb057824c6b966b9a8e7db68042cda6f3a25c00ac722ba762d811d","observation_id":"8544ec58-e517-4bfc-97f5-7b8cb41c1d5c","resolution":{"observed_at":"2026-08-06T13:22:44.438590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-06T05:57:51.199560Z","title":"Mobilevlm: A fast, strong and open vision language assistant for mobile devices,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01057","last_updated":"2025-08-12T12:29:02Z","snapshot_observed_at":"2026-08-06T05:57:50.237296Z","submitted_at":"2025-08-01T20:16:04Z","title":"Edge-Based Multimodal Sensor Data Fusion with Vision Language Models (VLMs) for Real-time Autonomous Vehicle Accident Avoidance","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T05:57:51.199560Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2508.01057"},"observation_digest":"sha256:069421027bdae6867dab8b2b0ce96c9d5dc2dd0600fa2662958c0d6e7f5181b1","observation_id":"9cb5ae6f-f0ba-420e-ac5c-d1904fbc2810","resolution":{"observed_at":"2026-08-06T05:57:51.199560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-06T05:36:17.046484Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-06T09:00:55.701513Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:17.046484Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:60790a2365368eca9c442cd216b96488d9cbee430f037c41c419c3fa9a3034e3","observation_id":"beb49cf1-6177-438f-96b7-487fb8f11626","resolution":{"observed_at":"2026-08-06T05:36:17.046484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-05T13:05:53.979850Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-05T13:05:51.875633Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:53.979850Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:245e7f86b1092e061898782645c4d609811cdeecd2577ce100c0a30b8e2d3dcd","observation_id":"c21867b7-2676-48dd-9917-21e5fb1f3d22","resolution":{"observed_at":"2026-08-05T13:05:53.979850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":"2312.16886","doi":"10.48550/arxiv.2312.16886","metadata_source":"pith","pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","venue":"cs.CV","work_id":"ef2b3279-e78f-44b7-abab-ed7d011dc1cf","year":2023},"citing_paper":{"arxiv_id":"2509.01944","last_updated":"2026-04-17T07:58:14Z","snapshot_observed_at":"2026-08-02T21:42:58.758339Z","submitted_at":"2025-09-02T04:32:24Z","title":"AutoDrive-R$^2$: Incentivizing Reasoning and Self-Reflection Capacity for VLA Model in Autonomous Driving","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T20:21:13.618080Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2509.01944"},"observation_digest":"sha256:3b9b2739b95227386807edfdf5b8a91a6d4830ca0423ad0eb048fa84af7b9523","observation_id":"ee357cca-4315-48c2-acb9-af6cfa5369e3","resolution":{"observed_at":"2026-05-18T20:21:49.925595Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":"2312.16886","doi":"10.48550/arxiv.2312.16886","metadata_source":"pith","pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","venue":"cs.CV","work_id":"ef2b3279-e78f-44b7-abab-ed7d011dc1cf","year":2023},"citing_paper":{"arxiv_id":"2509.21912","last_updated":"2026-04-15T06:09:32Z","snapshot_observed_at":"2026-08-02T07:15:59.205489Z","submitted_at":"2025-09-26T05:51:31Z","title":"Discrete Guidance Matching: Exact Guidance for Discrete Flow Matching","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T14:13:48.523955Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2509.21912"},"observation_digest":"sha256:332f8a45a003e893e8840d59d820f0ba8083864fc1d5b7fcd6983401364ab286","observation_id":"bf7c652b-a427-46d0-9d49-b5285bf40d4e","resolution":{"observed_at":"2026-05-18T14:16:27.818944Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":"2312.16886","doi":"10.48550/arxiv.2312.16886","metadata_source":"pith","pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","venue":"cs.CV","work_id":"ef2b3279-e78f-44b7-abab-ed7d011dc1cf","year":2023},"citing_paper":{"arxiv_id":"2509.22123","last_updated":"2026-05-13T12:28:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-26T09:46:13Z","title":"Multilingual Vision-Language Models, A Survey","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T13:02:08.000814Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2509.22123"},"observation_digest":"sha256:0fb770b39b22ae4d3e6a6601e80554c9fbfc56315d15799af88622f6ce22d99d","observation_id":"758da1d7-98a0-410d-9e64-8ddcd7f9aaac","resolution":{"observed_at":"2026-05-18T13:02:37.167925Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-03T21:31:34.208111Z","title":"Mobilevlm: A fast, strong and open vi- sion language assistant for mobile devices.arXiv preprint arXiv:2312.16886, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.15098","last_updated":"2026-06-21T15:38:16Z","snapshot_observed_at":"2026-08-03T21:31:33.690337Z","submitted_at":"2025-11-19T04:13:36Z","title":"A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T21:31:34.208111Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2511.15098"},"observation_digest":"sha256:ea9d4d2f01894e94f3f4cbcd3afbec1cd0e20a8ae47b3936360f94193c07c8d4","observation_id":"4e6be4e9-b84b-49bc-aee8-f89e98b47fba","resolution":{"observed_at":"2026-08-03T21:31:34.208111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-03T13:51:32.354806Z","title":"Mobilevlm: A fast, strong and open vision language assistant for mobile devices,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.22867","last_updated":"2026-07-03T08:07:47Z","snapshot_observed_at":"2026-08-06T02:32:25.163910Z","submitted_at":"2025-12-28T10:41:39Z","title":"MUSON: A Reasoning-oriented Multimodal Dataset for Socially Compliant Navigation in Urban Environments","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T13:51:32.354806Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2512.22867"},"observation_digest":"sha256:3dd88fd4b6191cd571ec0dd0a1e9a906b2390ab5c796fed1e1bb0e7ffd3f30a9","observation_id":"107c6774-e443-4879-901a-287cba4a438a","resolution":{"observed_at":"2026-08-03T13:51:32.354806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":"2312.16886","doi":"10.48550/arxiv.2312.16886","metadata_source":"pith","pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","venue":"cs.CV","work_id":"ef2b3279-e78f-44b7-abab-ed7d011dc1cf","year":2023},"citing_paper":{"arxiv_id":"2602.04476","last_updated":"2026-05-12T10:07:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-04T12:04:02Z","title":"Vision-aligned Latent Reasoning for Multi-modal Large Language Model","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T07:48:23.272002Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2602.04476"},"observation_digest":"sha256:3d499cb8f25f2b8a7088cd4f7f00717835b28bab90d890f296ba57b530e00fbe","observation_id":"0840b801-c090-4eee-8794-7591892f77bc","resolution":{"observed_at":"2026-05-16T16:35:38.347525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":"2312.16886","doi":"10.48550/arxiv.2312.16886","metadata_source":"pith","pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","venue":"cs.CV","work_id":"ef2b3279-e78f-44b7-abab-ed7d011dc1cf","year":2023},"citing_paper":{"arxiv_id":"2604.02689","last_updated":"2026-04-03T03:32:55Z","snapshot_observed_at":"2026-07-06T22:52:02.162758Z","submitted_at":"2026-04-03T03:32:55Z","title":"Efficient3D: A Unified Framework for Adaptive and Debiased Token Reduction in 3D MLLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T19:45:33.950587Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2604.02689"},"observation_digest":"sha256:975b32aae4d688b9f1c77355d2a441cb52e6dddecfc2605110ab89c8515f4851","observation_id":"32a198ba-a37e-4d71-81b4-07ff5d605fdc","resolution":{"observed_at":"2026-05-16T16:35:38.347525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":"2312.16886","doi":"10.48550/arxiv.2312.16886","metadata_source":"pith","pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","venue":"cs.CV","work_id":"ef2b3279-e78f-44b7-abab-ed7d011dc1cf","year":2023},"citing_paper":{"arxiv_id":"2604.04905","last_updated":"2026-04-06T17:50:47Z","snapshot_observed_at":"2026-07-06T22:53:46.999911Z","submitted_at":"2026-04-06T17:50:47Z","title":"ClickAIXR: On-Device Multimodal Vision-Language Interaction with Real-World Objects in Extended Reality","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T19:28:39.156433Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2604.04905"},"observation_digest":"sha256:470ae6fcd37590c6b45b8b7c667f9a01d6bc32a86d2ccb83e89b9284b70b0759","observation_id":"6aa81487-166b-4bac-a11a-a57a057b8454","resolution":{"observed_at":"2026-05-16T16:35:38.347525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-07-13T09:18:06.363249Z","title":"arXiv preprint arXiv:2312.168862(6), 7 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.05648","last_updated":"2026-06-19T12:00:19Z","snapshot_observed_at":"2026-07-13T09:18:01.987479Z","submitted_at":"2026-04-07T09:53:48Z","title":"Leaderless Collective Motion in Affine Formation Control over the Complex Plane","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-13T09:18:06.363249Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2604.05648"},"observation_digest":"sha256:871c56c492df4c6138588c3778c9409c00a5ba95a8fd15ad2981074ee2d31031","observation_id":"6be11098-9650-4c8c-91da-527d7c5d7eac","resolution":{"observed_at":"2026-07-13T09:18:06.363249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":"2312.16886","doi":"10.48550/arxiv.2312.16886","metadata_source":"pith","pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","venue":"cs.CV","work_id":"ef2b3279-e78f-44b7-abab-ed7d011dc1cf","year":2023},"citing_paper":{"arxiv_id":"2604.05649","last_updated":"2026-04-07T09:54:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-07T09:54:10Z","title":"Analogical Reasoning as a Doctor: A Foundation Model for Gastrointestinal Endoscopy Diagnosis","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T20:01:47.592716Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2604.05649"},"observation_digest":"sha256:5981d6d890e2ce7fa9c8a18866ca16095588929a302e5714e48b87723e503ef8","observation_id":"c15fe634-21dc-4ee7-8944-4d008ea7cbcf","resolution":{"observed_at":"2026-05-16T16:35:38.347525Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":"2312.16886","doi":"10.48550/arxiv.2312.16886","metadata_source":"pith","pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","venue":"cs.CV","work_id":"ef2b3279-e78f-44b7-abab-ed7d011dc1cf","year":2023},"citing_paper":{"arxiv_id":"2604.14629","last_updated":"2026-04-16T05:13:57Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:13:57Z","title":"Switch-KD: Visual-Switch Knowledge Distillation for Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T11:23:46.371799Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2604.14629"},"observation_digest":"sha256:dc1e479f269009ddaa38126dae1744eaf619a12c6aba2d07462854f3b064e025","observation_id":"dcf7a7eb-3404-492a-b339-c9dab0d6710c","resolution":{"observed_at":"2026-05-16T16:35:38.347525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":"2312.16886","doi":"10.48550/arxiv.2312.16886","metadata_source":"pith","pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","venue":"cs.CV","work_id":"ef2b3279-e78f-44b7-abab-ed7d011dc1cf","year":2023},"citing_paper":{"arxiv_id":"2604.24380","last_updated":"2026-04-27T12:10:44Z","snapshot_observed_at":"2026-07-06T23:10:24.992210Z","submitted_at":"2026-04-27T12:10:44Z","title":"Structural Pruning of Large Vision Language Models: A Comprehensive Study on Pruning Dynamics, Recovery, and Data Efficiency","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T03:47:38.100037Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2604.24380"},"observation_digest":"sha256:4d24a736ac8460b52b0713bb33669f0ea94d88cf86276d4c5c35854a26bfd87f","observation_id":"bf461f89-2f74-40b4-827d-c1c8a4055f2c","resolution":{"observed_at":"2026-05-16T16:35:38.347525Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":"2312.16886","doi":"10.48550/arxiv.2312.16886","metadata_source":"pith","pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","venue":"cs.CV","work_id":"ef2b3279-e78f-44b7-abab-ed7d011dc1cf","year":2023},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:c59977cf284885a87c0c9579c540faf2e2bbce62a292a55c809094445cd76090","observation_id":"649bd923-e9ca-44a5-82c5-65922f10d106","resolution":{"observed_at":"2026-05-16T16:35:38.347525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":"2312.16886","doi":"10.48550/arxiv.2312.16886","metadata_source":"pith","pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","venue":"cs.CV","work_id":"ef2b3279-e78f-44b7-abab-ed7d011dc1cf","year":2023},"citing_paper":{"arxiv_id":"2605.10641","last_updated":"2026-05-11T14:28:44Z","snapshot_observed_at":"2026-07-06T23:22:32.858399Z","submitted_at":"2026-05-11T14:28:44Z","title":"LLaVA-CKD: Bottom-Up Cascaded Knowledge Distillation for Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T05:10:56.991368Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2605.10641"},"observation_digest":"sha256:e7ea2e38264a5238a7c6e8303a72c9475775c3ca2774b20b40836ec22e2b5662","observation_id":"02e3ff45-293b-4d05-8686-c92064472421","resolution":{"observed_at":"2026-05-16T16:35:38.347525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":"2312.16886","doi":"10.48550/arxiv.2312.16886","metadata_source":"pith","pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","venue":"cs.CV","work_id":"ef2b3279-e78f-44b7-abab-ed7d011dc1cf","year":2023},"citing_paper":{"arxiv_id":"2605.31080","last_updated":"2026-05-29T09:47:45Z","snapshot_observed_at":"2026-07-06T23:40:17.605034Z","submitted_at":"2026-05-29T09:47:45Z","title":"A Pilot Study on Curator-Guided Multilingual Art Description for Blind and Low-Vision Audiences with Small Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T19:53:36.990878Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2605.31080"},"observation_digest":"sha256:9e2c459f1a5132c5c89554cbafc77426f682b10f38374d172cf69669c6c873f3","observation_id":"07461f87-4d39-4091-bb17-31721233a530","resolution":{"observed_at":"2026-06-28T20:22:37.626275Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":"2312.16886","doi":"10.48550/arxiv.2312.16886","metadata_source":"pith","pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","venue":"cs.CV","work_id":"ef2b3279-e78f-44b7-abab-ed7d011dc1cf","year":2023},"citing_paper":{"arxiv_id":"2606.21734","last_updated":"2026-06-19T20:43:49Z","snapshot_observed_at":"2026-08-05T18:05:51.515234Z","submitted_at":"2026-06-19T20:43:49Z","title":"HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning","version":1},"reference_index":284,"source":"arxiv_source","source_observed_at":"2026-06-26T14:19:53.450263Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2606.21734"},"observation_digest":"sha256:460ccbc433a7f9a2bdb14296274dbd7f9a8fb4142479f18c719146b6ef695ef9","observation_id":"0212a6fe-2139-4c8a-8a94-22d46d42a349","resolution":{"observed_at":"2026-07-04T06:39:37.659042Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":"2312.16886","doi":"10.48550/arxiv.2312.16886","metadata_source":"pith","pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","venue":"cs.CV","work_id":"ef2b3279-e78f-44b7-abab-ed7d011dc1cf","year":2023},"citing_paper":{"arxiv_id":"2606.27906","last_updated":"2026-06-26T09:54:33Z","snapshot_observed_at":"2026-07-07T00:02:04.432452Z","submitted_at":"2026-06-26T09:54:33Z","title":"Phase Matters: Characterizing Heterogeneous Vision-Language Inference on a Mobile SoC","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T02:16:11.064614Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2606.27906"},"observation_digest":"sha256:ccd41b6fc721d787ab8c8272188a00f3c973a5e51226e04cf5f3ecc3bfe53e1b","observation_id":"ce4311c0-fd57-4c09-b2c0-151d8bff0e98","resolution":{"observed_at":"2026-07-01T18:15:58.582593Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-07-11T21:12:37.909441Z","title":"MobileVLM: A fast, strong and open vision language assistant for mobile devices,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04171","last_updated":"2026-07-25T03:47:05Z","snapshot_observed_at":"2026-08-02T08:44:06.445347Z","submitted_at":"2026-07-05T08:34:39Z","title":"XS-VLA: Coupling Coarse-grained Spatial Distillation with Latent Flow Matching for Lightweight Robotic Control","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T21:12:37.909441Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2607.04171"},"observation_digest":"sha256:c8e0cbec7bd0b7545ff63a074fc0aa81c15f659e40e47d2e3e9322f8a770b5af","observation_id":"70f44998-7875-4e2f-b2f5-044cd5fb3dc5","resolution":{"observed_at":"2026-07-11T21:12:37.909441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-02T08:44:07.519769Z","title":"MobileVLM: A fast, strong and open vision language assistant for mobile devices,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04171","last_updated":"2026-07-25T03:47:05Z","snapshot_observed_at":"2026-08-02T08:44:06.445347Z","submitted_at":"2026-07-05T08:34:39Z","title":"XS-VLA: Coupling Coarse-grained Spatial Distillation with Latent Flow Matching for Lightweight Robotic Control","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T08:44:07.519769Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2607.04171"},"observation_digest":"sha256:b050a4db4497e7bc4a4b18ea7b83c12aa9b1c3c954abd45864a5d6bce3b25505","observation_id":"127e1a24-b813-411f-83a6-41c1d17c4cab","resolution":{"observed_at":"2026-08-02T08:44:07.519769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-07-11T16:01:25.344820Z","title":"arXiv preprint arXiv:2312.16886 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04637","last_updated":"2026-07-06T03:40:48Z","snapshot_observed_at":"2026-08-03T23:10:28.124746Z","submitted_at":"2026-07-06T03:40:48Z","title":"PixelPilot: Scalable Vision-Language-Action Models for End-to-End Autonomous Driving","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T16:01:25.344820Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2607.04637"},"observation_digest":"sha256:fbf24bbfbf36c4422deb0a77a30924c5e36d4cf0b8c57aac2b9cea4bffbd050a","observation_id":"3b719c83-217d-4fd3-87c7-9729ce56282b","resolution":{"observed_at":"2026-07-11T16:01:25.344820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":"2312.16886","doi":"10.48550/arxiv.2312.16886","metadata_source":"pith","pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","venue":"cs.CV","work_id":"ef2b3279-e78f-44b7-abab-ed7d011dc1cf","year":2023},"citing_paper":{"arxiv_id":"2607.08029","last_updated":"2026-07-09T01:13:18Z","snapshot_observed_at":"2026-08-05T10:26:29.110651Z","submitted_at":"2026-07-09T01:13:18Z","title":"Rethinking Small VLM Quantization: From Component-Wise Analysis to Hardware-Aware Edge Deployment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-10T13:26:41.210163Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2607.08029"},"observation_digest":"sha256:301abad921db1fdf3d868974b54b9e4ac20fd45bee4d28379c251c98bc5570db","observation_id":"1e20b9f0-c704-43bf-9450-8ca3804dcc56","resolution":{"observed_at":"2026-07-10T13:27:05.578693Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-07-14T15:39:36.100888Z","title":"Mobilevlm: A fast, strong and open vision language assistant for mobile devices,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09795","last_updated":"2026-07-09T06:14:14Z","snapshot_observed_at":"2026-08-02T12:34:45.189703Z","submitted_at":"2026-07-09T06:14:14Z","title":"Large Multimodal Model-Based Environment-Aware Mobility Management","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-14T15:39:36.100888Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2607.09795"},"observation_digest":"sha256:3d56330336a60197647218fd56f4681f6f2dcf0d10683fdc4c7e181d102914a2","observation_id":"dd5adc42-43ab-41aa-9abb-dd4a7f7e8259","resolution":{"observed_at":"2026-07-14T15:39:36.100888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-01T10:06:48.034588Z","title":"arXiv preprint arXiv:2312.16886 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20357","last_updated":"2026-07-22T16:43:27Z","snapshot_observed_at":"2026-08-01T10:06:46.754637Z","submitted_at":"2026-07-22T16:43:27Z","title":"Look Less, Think Faster: Joint Token-Compute Adaptation for Multimodal LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T10:06:48.034588Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2607.20357"},"observation_digest":"sha256:d11110f8e60b381f24d5aac00fbc017a575ecc2ce834fc8bc1d11310d7ed92c6","observation_id":"9675f9e0-1450-4c98-8d71-2426b9e48ead","resolution":{"observed_at":"2026-08-01T10:06:48.034588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-01T05:28:48.437022Z","title":"MobileVLM: A fast, strong and open vision language assistant for mobile devices,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22226","last_updated":"2026-07-24T11:49:25Z","snapshot_observed_at":"2026-08-03T09:19:17.231126Z","submitted_at":"2026-07-24T11:49:25Z","title":"Offline Vision-Language Navigation with Geometric Goal Localization for Outdoor Environments","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T05:28:48.437022Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2607.22226"},"observation_digest":"sha256:66b55da71a4a9ebf541bb81cf9f3adaf2bbe1e839303bddf5f0ef5c714c655c3","observation_id":"b3d1b04f-6506-415e-83b6-1b300d14a593","resolution":{"observed_at":"2026-08-01T05:28:48.437022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-01T11:49:57.611514Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22726","last_updated":"2026-07-22T05:17:38Z","snapshot_observed_at":"2026-08-05T17:48:01.260980Z","submitted_at":"2026-07-22T05:17:38Z","title":"PCA: Persistence-Aware Compression and Aggregation for Fast Video Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T11:49:57.611514Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2607.22726"},"observation_digest":"sha256:6a202932283219b4a45a982c6e8f4ccc11103452f2affc51bc86d8b93c724e28","observation_id":"5f0f4f26-7421-4712-afee-411e59cb818e","resolution":{"observed_at":"2026-08-01T11:49:57.611514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-01T02:14:09.818128Z","title":"arXiv preprint arXiv:2312.16886 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-03T21:55:22.610961Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.818128Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:5c5d3401e6789cc8675afc6d2bb378fe76595d9cc3b27a334543c7c675632f9b","observation_id":"33549019-2312-4c34-9195-99dedf88e1c9","resolution":{"observed_at":"2026-08-01T02:14:09.818128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-04T20:58:28.003330Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01785","last_updated":"2026-08-03T06:59:15Z","snapshot_observed_at":"2026-08-06T13:22:16.688904Z","submitted_at":"2026-08-03T06:59:15Z","title":"HorizonServe: Coordinating Request Scheduling with GPU Sharing for Omni-Model Serving","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:28.003330Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2608.01785"},"observation_digest":"sha256:d0e8bad4c1b7f6477ccf692b39ce3fef5867921829f30c26834e5d0f963f2df8","observation_id":"8693891f-9867-4b9e-a551-bceb8e669d47","resolution":{"observed_at":"2026-08-04T20:58:28.003330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2312.16886/citation-record","integrity":"/paper/2312.16886/integrity","json":"/paper/2312.16886/citation-record.json","paper":"/paper/2312.16886"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.11444","last_updated":"2023-12-24T12:25:10Z","snapshot_observed_at":"2026-07-06T17:04:46.288600Z","submitted_at":"2023-12-18T18:47:42Z","title":"An In-depth Look at Gemini's Language Abilities","version":2},"cited_work":{"arxiv_id":"2312.11444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.11444","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An in-depth look at gemini’s language abilities","venue":null,"work_id":"0a08125e-c6a1-40ab-99aa-8357f934a3d4","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2312.11444","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:c84fbc96e158ca0c29297c205aa8bc0fcc18adb8476600483e693a6100ced077","observation_id":"5eed6081-30a2-47ec-84b1-18e8d3952b82","resolution":{"observed_at":"2026-05-16T16:35:38.142322Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flamingo: a visual language model for few-shot learn- ing","venue":null,"work_id":"3eb5d477-e371-477c-9314-420a3b529fbf","year":2022},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:09213d4d8173ffab4654374319737f914c456976c4c4125075c10c32a855d1b2","observation_id":"9a6c8d66-6592-408e-b290-9bd0d3f1213c","resolution":{"observed_at":"2026-05-16T16:35:38.247234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Openflamingo, Mar","venue":null,"work_id":"8da6e5be-e048-46de-b0fb-94f732778270","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:30fdecf474d90ccef1777f80ab43fc9ee28616d31d41861110ec354638d1eb66","observation_id":"873f98c9-384f-402a-aed2-31c19988b0d4","resolution":{"observed_at":"2026-05-16T16:35:38.248955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":"2309.16609","doi":"10.48550/arxiv.2309.16609","metadata_source":"pith","pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen Technical Report","venue":"cs.CL","work_id":"bb1fd52f-6b2f-437c-9516-37bdf6eb9be8","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:86199dfa2dddc4998220db07234427c917ee91e7edf5408dd00e2e5a67038577","observation_id":"82d99c5d-308c-4bd1-a0fe-aa0fca777196","resolution":{"observed_at":"2026-05-16T16:35:38.032133Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:13bb3be5fd9e819ad6f24942bd0a2f71e0e3443f5158c0d4d69bff25408cd7f4","observation_id":"422cb836-9dae-40ac-8b80-4ef6b3a118ac","resolution":{"observed_at":"2026-05-16T16:35:38.049636Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vlmo: Unified vision- language pre-training with mixture-of-modality-experts","venue":null,"work_id":"a56a1fec-0ba3-44cd-962e-1d440a7dd1f0","year":2022},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:fcac9c6d778074da897acb5b7a11bb90ccd028f66b824bfd05ab1a92bd03179d","observation_id":"50ef19f7-43c4-4251-9ccd-6d36b85f0d17","resolution":{"observed_at":"2026-05-16T16:35:38.250741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pythia: A suite for ana- lyzing large language models across training and scaling","venue":null,"work_id":"01db513a-7ed1-44af-8816-68cab1b5b4e9","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:e01d84e6d1d5837d1db350a9b7cfc3ec87df061d4b3455575843164e32a0c70d","observation_id":"ffdd2359-c8f1-4b37-bfe7-a3c363be75cd","resolution":{"observed_at":"2026-05-16T16:35:38.252559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Piqa: Reasoning about physical commonsense in nat- ural language","venue":null,"work_id":"a197dc68-fe15-43d9-a99d-15caccb74893","year":2020},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:4e0c0544eeaa4e300dd2ea2e447b03feba8518a9848d2312423cc491290e98a3","observation_id":"3823f6cf-9c2f-4bd3-8fd9-616009c73303","resolution":{"observed_at":"2026-05-16T16:35:38.254455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GPT-Neo: Large Scale Autoregressive Lan- guage Modeling with Mesh-Tensorflow, Mar","venue":null,"work_id":"c68c5b2a-92ed-48a7-80cb-394a617c2e47","year":2021},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:53acbd0c547a5cd463e3bbca31766d0f5ea8ffc33f63b46faaa9f75073869285","observation_id":"2bb38b1d-1c60-4ea8-a2a8-6063c86ce214","resolution":{"observed_at":"2026-05-16T16:35:38.256566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.00358","last_updated":"2019-02-04T20:59:32Z","snapshot_observed_at":"2026-08-05T13:36:23.911192Z","submitted_at":"2018-06-01T14:06:45Z","title":"A Systematic Classification of Knowledge, Reasoning, and Context within the ARC Dataset","version":2},"cited_work":{"arxiv_id":"1806.00358","doi":null,"metadata_source":"pith","pith_arxiv_id":"1806.00358","snapshot_observed_at":"2026-06-29T23:14:02.080590Z","title":"A Systematic Classification of Knowledge, Reasoning, and Context within the ARC Dataset","venue":"cs.AI","work_id":"b99bd0ac-4cfe-4f6a-b865-48a01664b119","year":2018},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/1806.00358","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:6826b56ed4262761e71ec58d8f75050fa6c74861d64261934dcf7f54b1ff7545","observation_id":"0e688f61-389e-4b6d-bd22-50d92130cd59","resolution":{"observed_at":"2026-05-16T16:35:38.064120Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Coyo-700m: Image-text pair dataset","venue":null,"work_id":"afe9a739-54ad-4932-ae48-26b1e018b366","year":2022},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:fbb6fb7b75f81ce37f0191c2e748eef2cdb083fdf4f2dfa9135232abeb68ea30","observation_id":"6d8a0eb0-1608-4def-a6f6-3d96ccd01757","resolution":{"observed_at":"2026-05-16T16:35:38.258409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Once for all: Train one network and specialize it for efficient deployment","venue":null,"work_id":"c105b749-1d42-4c44-8fe9-1b0f819edb23","year":2020},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:54c9e888e0bc78be586b10e0980dad69540f545181dea899c13eb80b616f638f","observation_id":"0a18f4a3-615d-4dff-89dd-33da347041aa","resolution":{"observed_at":"2026-05-16T16:35:38.260676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conceptual 12m: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":"cb5e8ed2-1e35-45a6-9ef3-aaa82fbcfbd7","year":2021},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:571ff9fd707429ea8f963bf5814adb6cb6a78cf1d63a264eeda6c2b3108f5e9a","observation_id":"23e72aa8-0b56-4380-8ff1-17df27ab4a85","resolution":{"observed_at":"2026-05-16T16:35:38.262584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":"2310.09478","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-07-08T22:35:40.586981Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","venue":"cs.CV","work_id":"fb62cd1b-3991-40be-a987-3cfa5772b5b5","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:161e7b1be7ba5c50e231aa008c96aaefcdcd35f39a6622d6b389f3f747cf85c7","observation_id":"38c7a0ae-4178-4d44-a838-c0e90b49d1af","resolution":{"observed_at":"2026-05-16T16:35:38.068532Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":"2306.15195","doi":"10.48550/arxiv.2306.15195","metadata_source":"pith","pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","venue":"cs.CV","work_id":"44525076-312a-4259-b79c-134cd7eeb297","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:67bbf69851235639a5d43c1343ea134055de6dfdd96a312cf64c343dbbc9e5d7","observation_id":"92d2ae53-8923-421e-90b7-5444a2ee8872","resolution":{"observed_at":"2026-05-16T16:35:38.076284Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":"2311.12793","doi":"10.48550/arxiv.2311.12793","metadata_source":"pith","pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","venue":"cs.CV","work_id":"90e2b26a-3d27-4567-86b5-929b582a8034","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:9867ddeb074d46d74dd48a6bf48230da955fbcaff910a08c61c255eb76ab33ca","observation_id":"328bc085-e260-4e04-8f2f-7dd0eb4a2401","resolution":{"observed_at":"2026-05-16T16:35:38.125661Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15595","last_updated":"2023-06-28T04:26:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-27T16:26:26Z","title":"Extending Context Window of Large Language Models via Positional Interpolation","version":2},"cited_work":{"arxiv_id":"2306.15595","doi":"10.48550/arxiv.2306.15595","metadata_source":"pith","pith_arxiv_id":"2306.15595","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Extending Context Window of Large Language Models via Positional Interpolation","venue":"cs.CL","work_id":"c8b6df85-e7da-4bd8-90a4-d309cc2a0f60","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2306.15595","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:c6d133cc56b63f9339e64108e9d7000a483ec0fa5f3d788ebc8c5904068d4b8a","observation_id":"1ffb967a-1021-4cee-89a7-9aa628c5f519","resolution":{"observed_at":"2026-05-16T16:35:38.132466Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T10:38:12.283235+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T10:38:12.283235+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PaLI-X: On scaling up a multilingual vision and language model","venue":null,"work_id":"77c4f3a7-24ba-46cb-9223-93b77f745570","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:911503d34026616aac3acc391a4df17d38e2067764ec19d9fe9c3b6b7f8f9aa1","observation_id":"2dcbc99f-9354-4f97-8bb3-779a16c5e5fd","resolution":{"observed_at":"2026-05-16T16:35:38.264461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"cited_work":{"arxiv_id":"2209.06794","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.06794","snapshot_observed_at":"2026-07-04T19:30:07.491958Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","venue":"cs.CV","work_id":"29921cff-29c1-4aad-a27d-adac346027ec","year":2022},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2209.06794","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:549bf6e20cbe5632ee4f5226bcc5e5950299cea7aa2765ad59705ee8ffc53c72","observation_id":"90927561-6a15-468c-aeca-c9388a5a45e2","resolution":{"observed_at":"2026-05-16T16:35:38.046449Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":"8ae52a1e-2410-469a-b6cf-525b971fdcbd","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:6da75d2874bbb1e434d856e4cec8e2605c9411315e187e7e4b33e998b90e1dfd","observation_id":"08696784-6c65-4f33-8a16-260be8c5b887","resolution":{"observed_at":"2026-05-16T16:35:38.266220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Make repvgg greater again: A quantization-aware approach","venue":null,"work_id":"f0c005aa-a342-4c06-9ca9-a221dc5ce7b0","year":null},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:a20b25ecdcc02134a9cbb1194178b85ced07b352fee2f9a09b634d8e5c93386c","observation_id":"28a31722-64f4-438b-b82a-4669d5530dc2","resolution":{"observed_at":"2026-05-16T16:35:38.268222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Twins: Revisiting the design of spatial attention in vision transformers","venue":null,"work_id":"559a47f7-fe16-40e8-9731-43e265bc654d","year":2021},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:aaef5bcd0f588830c953b97417d0491b2ba4daab1114c8f18f57dbb7aa928ba8","observation_id":"df32ecc5-d200-4e25-b607-b1ad62bac922","resolution":{"observed_at":"2026-05-16T16:35:38.270095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conditional positional encodings for vision transformers","venue":null,"work_id":"f1355fc5-4d23-41f1-9e4e-9f5138b592e9","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:44a284b81a9f4d36d1af2bbf492642f663a5d2e365d7daff1591a3ad31d0a583","observation_id":"a1d797ff-8af9-4fe5-8eda-251ce438f4b6","resolution":{"observed_at":"2026-05-16T16:35:38.272095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fairnas: Re- thinking evaluation fairness of weight sharing neural archi- tecture search","venue":null,"work_id":"1de153cb-ee33-426a-b0f1-83264c0e9f3c","year":null},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:d4862c314825edd004b317e3c594707fed60dfbc492aaa57f0e1ef1a17490aba","observation_id":"073406e1-8916-42af-8ab9-7eadd8de39c6","resolution":{"observed_at":"2026-05-16T16:35:38.274464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fair darts: Eliminating unfair advantages in differentiable architecture search","venue":null,"work_id":"7b12e51b-a9ea-45f0-aea7-1bb9fcd1b9f2","year":2020},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:773c7f0407051ad8f2e35829f51e7a7d1943ae9141f6908a1d5dd8a38a756581","observation_id":"36b2cbfa-e7c2-485f-98d7-5dd4ace69ba5","resolution":{"observed_at":"2026-05-16T16:35:38.276338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11416","last_updated":"2022-12-06T21:39:48Z","snapshot_observed_at":"2026-07-06T14:08:18.855958Z","submitted_at":"2022-10-20T16:58:32Z","title":"Scaling Instruction-Finetuned Language Models","version":5},"cited_work":{"arxiv_id":"2210.11416","doi":"10.48550/arxiv.2210.11416","metadata_source":"pith","pith_arxiv_id":"2210.11416","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Instruction-Finetuned Language Models","venue":"cs.LG","work_id":"8405abb1-7558-4fdf-af24-f4c52fa77a06","year":2022},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2210.11416","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:f151688f4f2c30c3ca64d265155596494e6ff683e296cb5317ee6f37e17223f2","observation_id":"2df0cd91-cc59-4538-8507-2a82a43c1f0c","resolution":{"observed_at":"2026-05-16T16:35:38.155666Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":"1905.10044","doi":"10.48550/arxiv.1905.10044","metadata_source":"pith","pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","venue":"cs.CL","work_id":"511eeb84-4b95-46d5-b14f-50da43f4f19f","year":2019},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:baaa6c91d3177b6e31c9ceab1e0c091255bf03a682fa54e45c502eb2cc70b7cd","observation_id":"ad70d21e-b604-4acd-ad03-d529cc1c126e","resolution":{"observed_at":"2026-05-16T16:35:38.181380Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:54da3966cceed258e35d700ae835a176d7a08e2d32a2a3a6154fdb8d7d83fc97","observation_id":"c35004e5-ffe4-4e82-a64d-d900f1b33fab","resolution":{"observed_at":"2026-05-16T16:35:38.010976Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Redpajama: An open source recipe to reproduce llama training dataset","venue":null,"work_id":"9e9bc6c0-f1e7-4b9f-8b41-8f8193c7dce3","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:66d954babe07b94dee3182769a59994dc0c2eebdd1f603152ccc47064aaaea74","observation_id":"302f9f3e-d267-4bd8-9c09-b0afa9900015","resolution":{"observed_at":"2026-05-16T16:35:38.278458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2305.06500","doi":"10.48550/arxiv.2305.06500","metadata_source":"pith","pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","venue":"cs.CV","work_id":"f3aac728-ded0-4e55-aa9e-4a1635d4313d","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:1bb060e70dd808fd3b01d000523a8cc5f66b1d8256f4c3a4cb9d6bdfdac15f92","observation_id":"8591879d-9bf4-4c6b-ad1e-7f9cdddb7cfa","resolution":{"observed_at":"2026-05-16T16:35:38.039764Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:51.838916+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:51.838916+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":"2307.08691","doi":"10.48550/arxiv.2307.08691","metadata_source":"pith","pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","venue":"cs.LG","work_id":"fff3953b-5efb-4753-bee4-002f59995810","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:0a94f627741c7db1601f7b24e5e8fcef41bbb8ee501995047f2288159f041b91","observation_id":"5db8b8e8-b9d1-4bff-8c63-8bb62b17efde","resolution":{"observed_at":"2026-05-16T16:35:38.043166Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:18.243793+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:18.243793+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Embodied question answering","venue":null,"work_id":"8c686582-7dcb-4eba-9c4e-ef3ce6f32e9b","year":2018},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:1bfb7a1a43bc4b0f17323e0d2318295a4d23a61216481b73b0dc25775f1838c6","observation_id":"10fb5702-1e3b-433d-9801-311a5d72d28c","resolution":{"observed_at":"2026-05-16T16:35:38.280167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagenet: A large-scale hierarchical im- age database","venue":null,"work_id":"d4e73c33-2745-46a5-bd5c-3d230329e616","year":2009},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:0fdd43e2d67e6180b3df1af4f0cea4affeb9aa2bb47a69d921aa4650255c1e51","observation_id":"bfb21d82-0780-48e2-a22d-875f808224cf","resolution":{"observed_at":"2026-05-16T16:35:38.282108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":"2010.11929","doi":"10.1175/jcli-d-22-0357.1","metadata_source":"pith","pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":"cs.CV","work_id":"e96730e3-129b-4db6-b981-15ab7932e297","year":2020},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:df88857905593df2f6826c8b5336b420913b41d826372f87000b9d56fe5b79be","observation_id":"35d22039-aa0c-4796-8d4d-aa09caa2b567","resolution":{"observed_at":"2026-05-16T16:35:38.052654Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.10360","last_updated":"2022-03-17T11:49:55Z","snapshot_observed_at":"2026-07-06T10:51:12.871009Z","submitted_at":"2021-03-18T16:30:26Z","title":"GLM: General Language Model Pretraining with Autoregressive Blank Infilling","version":2},"cited_work":{"arxiv_id":"2103.10360","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.10360","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2103.10360 , year=","venue":null,"work_id":"46d7bb97-b94f-4fe6-8291-6d532f004dfa","year":2021},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2103.10360","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:53ae25dcec55c2dbf57ff15b7f75c4a1df5be73ddbe492d322877de6749f97ab","observation_id":"0f6e36c1-d041-40e0-a38c-e74bf1b91b45","resolution":{"observed_at":"2026-05-16T16:35:38.059819Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey of embodied ai: From simulators to research tasks","venue":null,"work_id":"aac333a3-9728-486b-bc12-c9de96249619","year":2022},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:acf8155df1b96ce49183ac93e00c5d0507edffa01dac5af7f01d88ac653c2759","observation_id":"0a2105fa-f271-4aee-b25e-1ce4dde7c76f","resolution":{"observed_at":"2026-05-16T16:35:38.284070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eva: Exploring the limits of masked visual represen- tation learning at scale","venue":null,"work_id":"a76d467d-3ab4-48ea-89f5-946e8a85d3a8","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:750fb4b4a8f35072141eb2313b3017776e58909e353e61ed9a088fdf5ca66003","observation_id":"6295a966-5c89-46b3-a756-1ec222594cc7","resolution":{"observed_at":"2026-05-16T16:35:38.285895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sparsegpt: Massive lan- guage models can be accurately pruned in one-shot","venue":null,"work_id":"25c574a6-ef4c-4fba-85b8-23533b6fcc20","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:260a88dd9afa1d27d2eedf09885418ecfeae4e7c7fa274c583aa69184dc44ad2","observation_id":"a63b2f0c-5f60-4e71-91d0-277d708c92d3","resolution":{"observed_at":"2026-05-16T16:35:38.287680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-07-31T03:44:36.976336Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":"2210.17323","doi":"10.48550/arxiv.2210.17323","metadata_source":"pith","pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","venue":"cs.LG","work_id":"19ed8c44-202a-48f6-8169-637d5a5f2408","year":2022},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:310b5c462fb071ab34d206578790ff88561b7b5770b2eea7a5e4e9ebd2ec6069","observation_id":"3ac9a826-a65c-4a87-b305-f184f6274905","resolution":{"observed_at":"2026-05-16T16:35:38.082967Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-17T20:22:03.028003+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-17T20:22:03.028003+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":"2306.13394","doi":"10.48550/arxiv.2306.13394","metadata_source":"pith","pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-10T13:27:05.561984Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","venue":"cs.CV","work_id":"806d2e73-71b3-4d56-87e0-39d571cc15d6","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:95e2970f96f9dc78d8b9fd8feb318b2290b36840acc7e67a055959d26ee84409","observation_id":"e60859bd-4589-4735-9992-a89e9deddac2","resolution":{"observed_at":"2026-05-16T16:35:38.103894Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12436","last_updated":"2023-12-20T12:40:47Z","snapshot_observed_at":"2026-07-06T17:05:31.586924Z","submitted_at":"2023-12-19T18:59:22Z","title":"A Challenger to GPT-4V? Early Explorations of Gemini in Visual Expertise","version":2},"cited_work":{"arxiv_id":"2312.12436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.12436","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A challenger to gpt-4v? early explorations of gemini in visual expertise","venue":null,"work_id":"05e8c0d7-6676-46bf-b64f-97140c19f4c5","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2312.12436","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:6badd7e879ab53fea65e1aa2aa325d65c41ce0ccdba51cbaae6b40ef3a3ad12a","observation_id":"737d77a7-40dc-464e-9c30-c372d0fa1ddf","resolution":{"observed_at":"2026-05-16T16:35:38.122002Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A framework for few-shot language model evaluation, Sept","venue":null,"work_id":"4cd4243f-d20e-4d7b-9807-50d789f0fc7e","year":2021},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:0e1c312330c99fe30b01a4426c4c55cae577bfba52b15fbb3d538030060c23f7","observation_id":"9e65d224-ec56-4236-b6b3-4d560624157c","resolution":{"observed_at":"2026-05-16T16:35:38.289493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Openllama: An open repro- duction of llama, May 2023","venue":null,"work_id":"9a52ad2e-ee18-417e-887d-1323a6c6b8dd","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:7d80867f3c45852c93e03fd97a6b5fc0232ea225bee41a1c00e679c34cd9dce6","observation_id":"03476a30-b7d4-46a8-99b4-43e50c740663","resolution":{"observed_at":"2026-05-16T16:35:38.291252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"llama.cpp","venue":null,"work_id":"93be5af7-182d-47a8-86af-96195aec47f8","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:72c2d26844034fa187c73ebde81ec6c6d3dd8d0bbfbd86521da795c4fd7c3ca1","observation_id":"dcd0370e-3fb7-48ef-a530-dac1ac6e84a9","resolution":{"observed_at":"2026-05-16T16:35:38.292874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini: A family of highly capable multimodal models","venue":null,"work_id":"11c00fff-e2fa-4c34-b1c4-b155d62fdece","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:d0afd164595b9c5839ba5b6d07d520df947b096df041285ffd31bfe258226d3e","observation_id":"a3dc4b4c-cd0c-4d35-b5bf-42ac39257f17","resolution":{"observed_at":"2026-05-16T16:35:38.294761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11644","last_updated":"2023-10-02T06:12:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-20T16:14:25Z","title":"Textbooks Are All You Need","version":2},"cited_work":{"arxiv_id":"2306.11644","doi":"10.48550/arxiv.2306.11644","metadata_source":"pith","pith_arxiv_id":"2306.11644","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Textbooks Are All You Need","venue":"cs.CL","work_id":"9b14eca2-9e41-4755-88ac-c3e7b67253f5","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2306.11644","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:17587754151fc8d2cdd80c42d8f4f1f6e893fd7f8692d6ffd6f7ead76c934660","observation_id":"a14c2259-bd3d-416a-a275-586dea7a3d24","resolution":{"observed_at":"2026-05-16T16:35:38.002241Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Masked autoencoders are scal- 13 able vision learners","venue":null,"work_id":"fd9665a3-d2ee-4cac-842a-a89fb949ab86","year":2022},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:0b76256d0425401d0a2587365dea7f029dfbd3043870c546c3b1bdafaa9bcdef","observation_id":"8e036432-74a5-47e1-9e8c-82efbaaafe0d","resolution":{"observed_at":"2026-05-16T16:35:38.296658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:05a778d46f353d6ca17fabb902043a51cd31b5310796833545d30d1d163aec2a","observation_id":"e77f146a-1e49-463e-8746-cdf617c5c504","resolution":{"observed_at":"2026-05-16T16:35:38.014977Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":"2203.15556","doi":"10.1098/rsta.2024.0522","metadata_source":"pith","pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Compute-Optimal Large Language Models","venue":"cs.CL","work_id":"b2faf28d-86b7-429c-bc42-469458efc246","year":2022},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:6d85c2de7944a7ced16f58bdf9385630f60d37ee3130e5ba36d3219bad8cd3c0","observation_id":"b4df69e2-8710-478e-8ae2-a72a8df3a3e3","resolution":{"observed_at":"2026-05-16T16:35:38.028539Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Searching for mo- bilenetv3","venue":null,"work_id":"7513f3d5-1425-4389-8cff-48df901f0ab5","year":2019},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:7bc1535fb6fad821da6d391af4dde5e7cbebdec4bebd3763fe53d8e09d7fe978","observation_id":"5f16640c-acd2-4163-a6dc-76cca1fba923","resolution":{"observed_at":"2026-05-16T16:35:38.298229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":"2106.09685","doi":"10.4088/pcc.v03n0609","metadata_source":"pith","pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","venue":"cs.CL","work_id":"0426219a-789e-4964-adc8-a04538510818","year":2021},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:c27deb87a53941704f83d0b74c668e94d7eb21e0b35a5bdd3eec3f89de62aa4a","observation_id":"933f94f3-ccc7-41ea-aaed-e3320391d3c9","resolution":{"observed_at":"2026-05-16T16:35:38.035996Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"3fcdc5e9-e47f-48a3-867e-b9d2c607275d","year":2019},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:dc8a2250fd3c5d74237b7ab189e2e16a4a09328eab69292311acf76a43f70764","observation_id":"a4a53bcd-cb2b-45e7-a417-8e883dbf48d8","resolution":{"observed_at":"2026-05-16T16:35:38.300025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://huggingface.co/datas ets/Aeala/ShareGPT_Vicuna_unfiltered","venue":null,"work_id":"a56eeb1b-cdc3-47bb-a474-90a43ec23683","year":null},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:6cfae56b25be607e0e4e4e89ea9505f6e4d8a2d1e57d2981b037c8d003b0b910","observation_id":"8d6e5942-d8a6-41ec-b681-0b0676532875","resolution":{"observed_at":"2026-05-16T16:35:38.301907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open- clip","venue":null,"work_id":"07ccfb58-7fd8-45aa-a22b-47b6c3d9189b","year":2021},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:4d0ae21c125b8057c78a49f2f04b96ea7275b791e55ad965633bbdb4bde899d6","observation_id":"d47b5c20-598d-4950-81d2-20fa4755a198","resolution":{"observed_at":"2026-05-16T16:35:38.303517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lmdeploy","venue":null,"work_id":"31e8f344-dceb-480a-83c6-078e6b4eb119","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:f6fd03dee9d456c148cbbef430c5a5d2ca5cc8a3aab6cd37475ec1cfd7b217d9","observation_id":"f69b14af-a604-4e8a-92cd-11deb3ac7976","resolution":{"observed_at":"2026-05-16T16:35:38.305170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Batch normalization: Accelerating deep network training by reducing internal co- variate shift","venue":null,"work_id":"b06e95df-8211-4303-8180-468e5c3b78f2","year":2015},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:6006965122b870c8652c8c139d80143c4d682c7eee5a377259d265b7c60b763f","observation_id":"e5a389ee-a58f-4d3c-b6d2-cb26d14a3b3b","resolution":{"observed_at":"2026-05-16T16:35:38.307044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Perceiver: General perception with iterative attention","venue":null,"work_id":"9341bd04-b8ca-4fdd-89d6-840e86807472","year":2021},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:e643f756d143a6411e300013a7b17472f1cbd640425ddf6215e8115e69758135","observation_id":"d4a9c367-42c4-476c-a66d-dc3760b04540","resolution":{"observed_at":"2026-05-16T16:35:38.308809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"3da5e7c4-f471-4bc1-b9fa-c8a25bab6053","year":null},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:45ee7920b7d46718295af0a5a37a4389e82c4cbd40c9ebd164f97a33f45b0963","observation_id":"a2c1b2ac-18e2-461e-8706-2745423212b4","resolution":{"observed_at":"2026-05-16T16:35:38.310803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"All tokens matter: Token labeling for training better vision transform- ers","venue":null,"work_id":"ceefbb18-1473-4696-8368-f831551722d8","year":2021},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:e9e66bd1247491729ae82056a054c2c588bb3230415aee37b8282ee6d7267de2","observation_id":"e5b420d7-adbf-4aaf-af84-8af249c875f5","resolution":{"observed_at":"2026-05-16T16:35:38.312677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:62f669a0afaf695beb805f4151b2d5b8e20ad09cea98e0594c96aa21a8cf4afb","observation_id":"2dff6c21-50af-4b6e-a69d-1ee871d077f3","resolution":{"observed_at":"2026-05-16T16:35:38.072521Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Referitgame: Referring to objects in pho- tographs of natural scenes","venue":null,"work_id":"960d4a7a-1b7a-4308-8398-434b8514a1c3","year":2014},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:a1a778334a0f86a6adf67f94f0ef70ea26aac62c4d20cdd22f027b1d09837a64","observation_id":"49e4294c-b6d2-40a9-a847-65c624f3ab35","resolution":{"observed_at":"2026-05-16T16:35:38.314444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual Genome: Connecting language and vision using crowdsourced dense image annotations","venue":null,"work_id":"e2af7b20-c689-4aaa-9d21-f935a49a0251","year":2017},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:80845f44eb5fd801d8fd921f7d8f7342bb1ab9afc6ac7ba1ea93ee913bd8a917","observation_id":"d8299f2f-12b9-49f4-b6f0-04d94acd54df","resolution":{"observed_at":"2026-05-16T16:35:38.316229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.06226","last_updated":"2018-08-19T16:49:06Z","snapshot_observed_at":"2026-07-06T06:56:20.935388Z","submitted_at":"2018-08-19T16:49:06Z","title":"SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing","version":1},"cited_work":{"arxiv_id":"1808.06226","doi":"10.18653/v1/d18-2012","metadata_source":"doi_reference","pith_arxiv_id":"1808.06226","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Sentencepiece: A simple and language independent subword tokenizer and detokenizer for neural text processing","venue":"cs.CL","work_id":"81a6320b-c2e1-4d74-a03e-9e1ff6bbed8d","year":2018},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/1808.06226","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:56929a03803f2e7642266fe393746fd286c269a54b12840123da1c11d41f3c0c","observation_id":"0c7eda0c-6262-4e7e-acd7-f164e4293e39","resolution":{"observed_at":"2026-05-16T16:35:38.090406Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T12:19:12.876508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T12:19:12.876508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.16527","last_updated":"2023-08-21T09:35:52Z","snapshot_observed_at":"2026-07-06T15:48:01.777256Z","submitted_at":"2023-06-21T14:01:01Z","title":"OBELICS: An Open Web-Scale Filtered Dataset of Interleaved Image-Text Documents","version":2},"cited_work":{"arxiv_id":"2306.16527","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.16527","snapshot_observed_at":"2026-07-01T22:26:17.906208Z","title":"Obelisc: An open web-scale filtered dataset of interleaved image-text documents","venue":null,"work_id":"74ebae26-b926-4191-8a01-1743f30cca60","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2306.16527","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:259e6aa9124b79fc93a96fcd719df5b7ab630cd60fe07aded68a5e6d970384ae","observation_id":"5ec7f977-5bef-4bc9-841f-d3a5ff70f55e","resolution":{"observed_at":"2026-05-16T16:35:38.099866Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The BigScience corpus: A 1.6 TB composite multilingual dataset","venue":null,"work_id":"2cb902a9-3f68-4a0b-ad92-567b192fbd33","year":2022},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:328534afd05369f0d25a4e7326f8ba25f60886f27ae71a1f328ff9801bd48d8b","observation_id":"68033dde-e150-45e1-af36-3de428b9d311","resolution":{"observed_at":"2026-05-16T16:35:38.318061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":"2301.12597","doi":"10.48550/arxiv.2301.12597","metadata_source":"pith","pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","venue":"cs.CV","work_id":"63d03f4d-15f4-4583-8286-913c19f02294","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:3bb8161c17f994079f9d875f1f2d5c0d4bf74e561befd9d1f3977c45c0fab403","observation_id":"7b99d196-54b5-41c2-b81e-1d91eb5086d5","resolution":{"observed_at":"2026-05-16T16:35:38.107789Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:47.354893+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:47.354893+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blip: Bootstrapping language-image pre-training for uni- fied vision-language understanding and generation","venue":null,"work_id":"a223aea1-83fe-4608-acb3-6a5e83bfd273","year":2022},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:154c17ab1517a202c131dbad68d1e5b68b0ad4e862803f5cd6ed3308163d1a34","observation_id":"9d1f22ca-9f4f-4c36-b1be-13570d961154","resolution":{"observed_at":"2026-05-16T16:35:38.319879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Norm tweaking: High-performance low-bit quantization of large language models","venue":null,"work_id":"955d654a-cae0-46fc-9b96-77abf6dfaaf1","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:f20447da71ecf434796e1cac0c3a4ed2aa1be59b5c1a9fe58a1d9694faffc00a","observation_id":"beb53d52-047f-4599-9340-e878f1420168","resolution":{"observed_at":"2026-05-16T16:35:38.321618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.02244","last_updated":"2019-09-05T07:31:58Z","snapshot_observed_at":"2026-08-05T17:21:59.962282Z","submitted_at":"2019-09-05T07:31:58Z","title":"Robust Navigation with Language Pretraining and Stochastic Sampling","version":1},"cited_work":{"arxiv_id":"1909.02244","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1909.02244","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust navigation with language pretraining and stochastic sampling","venue":null,"work_id":"9a4d7eb6-2f27-4259-aaa9-ff873b984558","year":1909},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/1909.02244","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:d54a5f24d336f09b53b1e240befe3718689754bbe9125cd9a9acad939ba92f11","observation_id":"c6a0b4f5-b26f-4338-96cc-7f572b56764e","resolution":{"observed_at":"2026-05-16T16:35:38.129434Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Textbooks are all you need ii: phi-1.5 technical report","venue":null,"work_id":"571a7df9-c405-4aef-a2aa-0e781400ee52","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:0b00e64e346cbb7c60b6b76e9a94b06b2b2f4419515b81b25630dea52db92926","observation_id":"8f619819-ecf7-445c-a550-cfa079e72352","resolution":{"observed_at":"2026-05-16T16:35:38.323332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2305.10355","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-07-10T11:37:03.198858Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","venue":"cs.CV","work_id":"66d8ac3e-c134-4995-b528-550afa17586f","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:d8b67258fcf70cc8387c5883087f032c4e16e1ff43fca6928534239da005c95a","observation_id":"d0a8acde-0082-4f6e-8b3f-e1397f65f665","resolution":{"observed_at":"2026-05-16T16:35:38.135577Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":"2109.07958","doi":"10.48550/arxiv.2109.07958","metadata_source":"pith","pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","venue":"cs.CL","work_id":"22e3b047-a6e8-4c4c-b62e-173b545a1a45","year":2021},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:645f8307374a7ca6e4c6fc3da422bef76c4492ce2c92a6745d0b74557c46bc3a","observation_id":"865da393-55ea-4b98-8ac0-24f12e83a6d9","resolution":{"observed_at":"2026-05-16T16:35:38.145468Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-18T08:21:09.956602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T08:21:09.956602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Microsoft COCO: Common objects in context","venue":null,"work_id":"eb6a9700-1eb1-46ff-bd27-2680d3327123","year":2014},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:436ac12f664007465ae5d60683b043789004d0765a9676410f2572f299baa807","observation_id":"34f16562-3adc-475a-b790-d53553048611","resolution":{"observed_at":"2026-05-16T16:35:38.324982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2310.03744","doi":"10.48550/arxiv.2310.03744","metadata_source":"pith","pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improved Baselines with Visual Instruction Tuning","venue":"cs.CV","work_id":"5baeaa33-5986-44a3-85a4-fcabd6fc1e8d","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:d0e9a76bcbceb5a82183b494e73637695aeda2b4bb63551998598b26ff6599e1","observation_id":"57fd6cf6-0a2d-480a-a375-e2aa56453032","resolution":{"observed_at":"2026-05-16T16:35:38.165174Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2304.08485","doi":"10.48550/arxiv.2304.08485","metadata_source":"pith","pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual Instruction Tuning","venue":"cs.CV","work_id":"68be622d-a6dc-4a13-82de-e3054a3dc509","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:532fdf4c71adbe8799742844ff998d115062cf177ba1df695d6f5c252159e7b6","observation_id":"ac10e24e-ec33-4669-936b-9141b317ad2b","resolution":{"observed_at":"2026-05-16T16:35:38.168341Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:44.742124+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:44.742124+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DARTS: Differentiable architecture search","venue":null,"work_id":"74464330-810a-45f2-a430-2c587c564599","year":2019},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:bbbda5441f1541709d7ff1d5279d0f5f8e5cd35f7b554d350ea5d1a6e84f10ac","observation_id":"9f394269-8989-4ea1-9124-00d27ed7ad6e","resolution":{"observed_at":"2026-05-16T16:35:38.326694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05437","last_updated":"2023-11-09T15:22:26Z","snapshot_observed_at":"2026-07-06T16:45:15.785513Z","submitted_at":"2023-11-09T15:22:26Z","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","version":1},"cited_work":{"arxiv_id":"2311.05437","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05437","snapshot_observed_at":"2026-07-01T10:35:41.926606Z","title":"Llava-plus: Learning to use tools for creating multimodal agents","venue":null,"work_id":"9c2031ce-7083-4715-8a00-67d6870081c8","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2311.05437","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:9314d59d8bb5a0f2cdad8b39ad915b91f8d7a79d1ba487c0bbd9f0939ec8e637","observation_id":"b96c18cb-aa7d-4802-81af-1c9b31884c8a","resolution":{"observed_at":"2026-05-16T16:35:38.185520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":"2303.05499","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-07-10T23:17:45.410080Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","venue":"cs.CV","work_id":"3757dc8f-79d5-4beb-a03b-eb4c9a33427d","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:91a2e0e286df37ce9d36a61e3dc8a06cc31fc94f50a272138a9ae0c31d054cb4","observation_id":"47c53e94-dbcb-405f-a482-606ca0db2f7b","resolution":{"observed_at":"2026-05-16T16:35:38.188510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":"2307.06281","doi":"10.48550/arxiv.2307.06281","metadata_source":"pith","pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","venue":"cs.CV","work_id":"3b44943d-0f15-4228-9ac3-0e376f4f9ada","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:5833063aab53aeec8471bd14a9169c0eefe719637b95f2a65b5911b7e1c68439","observation_id":"0139974d-b3f5-45f7-ae89-6004eb77eb88","resolution":{"observed_at":"2026-05-16T16:35:37.997679Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"796d171d-659d-4da8-b53b-170e1f551c17","year":2021},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:a6aae404bdbaf05762b63526f6436cf4bf4b3e393afbf973900292c7f5619667","observation_id":"0119f562-4fbf-4861-a8e2-ca9ab1224706","resolution":{"observed_at":"2026-05-16T16:35:38.328623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:7d1053612d4aaf575e01982f12d2f14a538c699c29bd7a71e0be6776f3569f7d","observation_id":"d2c63f41-a7c0-4422-b4dc-adbff138177c","resolution":{"observed_at":"2026-05-16T16:35:38.006636Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"42a56154-1e0f-46a0-bc8b-ee6f18411cee","year":2022},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:f243e357c52ad156e5784c885c6fafc826bfbc6c53e7e1ec5978b032cafcc178","observation_id":"bbc97eb4-c8e9-4d24-9850-dd14cd9582fb","resolution":{"observed_at":"2026-05-16T16:35:38.331717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llm- pruner: On the structural pruning of large language models","venue":null,"work_id":"962a6f8d-2820-4e32-af1e-30bd9f74c62c","year":null},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:2e9a9a21970a66778c6840516dd9c7ab6a8e281fe1f3312e63635a7b51be5f82","observation_id":"e7a12bf6-2719-4ab5-a4a7-53fc837e0db9","resolution":{"observed_at":"2026-05-16T16:35:38.333807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13681","last_updated":"2022-02-18T05:50:50Z","snapshot_observed_at":"2026-08-05T16:29:39.348508Z","submitted_at":"2020-11-27T11:43:45Z","title":"Point and Ask: Incorporating Pointing into Visual Question Answering","version":4},"cited_work":{"arxiv_id":"2011.13681","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2011.13681","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Point and ask: Incorporating pointing into vi- sual question answering","venue":null,"work_id":"6d179202-83f7-4f97-ad9b-26a8568517e6","year":2011},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2011.13681","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:9050cf66b472440e56901a55d07626839a33cb9d7915d080ba11fc0b11932199","observation_id":"1ca7654c-62d6-4396-b761-4f444b76aa15","resolution":{"observed_at":"2026-05-16T16:35:38.019655Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15021","last_updated":"2023-09-13T23:46:22Z","snapshot_observed_at":"2026-07-06T15:32:25.931739Z","submitted_at":"2023-05-24T11:04:30Z","title":"EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought","version":2},"cited_work":{"arxiv_id":"2305.15021","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15021","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Embodiedgpt: Vision-language pre-training via embodied chain of thought","venue":null,"work_id":"c6649c65-8cc1-4f03-9b0d-fe81390ba1cc","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2305.15021","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:aea0c10e1e3eb5b2dfecb5eacbc23a3df74ed51034c3e665f2a513b690301692","observation_id":"e7427b10-da64-4515-bb17-faef5e9396a3","resolution":{"observed_at":"2026-05-16T16:35:38.024396Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tensorrt-llm","venue":null,"work_id":"d93b7e0f-5d54-49c3-8a4f-2435786f445f","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:035b3e22bbdff68d52662de31e512725181099bd8799bff20f4ba6ef157f1131","observation_id":"148cc151-c4dc-4e4b-bd3d-06c5ae20a752","resolution":{"observed_at":"2026-05-16T16:35:38.336388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"78b17a17-99c0-4a6b-b5dd-073ba531b12c","year":null},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:1361052943510d903a637fdde5aca51c920da12ddb8bcfb44f04cf33c8169cfe","observation_id":"219821da-8d84-4602-9232-96b1e4c2e5b8","resolution":{"observed_at":"2026-05-16T16:35:38.338160Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"708d6a76-3804-4689-91e8-44bb9d4f4bf1","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:bd4c98240652509ffebb95e6183d57e9f7da024e6db1f94fba81a38dddc71a44","observation_id":"a6fe276b-6f9b-409c-b73a-51ad5964071d","resolution":{"observed_at":"2026-05-16T16:35:38.339857Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-4 technical report","venue":null,"work_id":"93fb9d0a-1e1a-415c-bfff-ad99a3b5c056","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:61703cbee75a6354ebdcab3c241189aa3782ccbb298a607aeefa2d43f9114e55","observation_id":"c07eaf40-cdad-4231-9321-995fe585770d","resolution":{"observed_at":"2026-05-16T16:35:38.341623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":"430fe5de-2ee3-4244-b935-e9c7dea17a6a","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:4176ceb63d295477308156d0ca1491ae1208891431ec8a14be957e48cb7390cd","observation_id":"071a0a7d-d622-4f73-8740-f238164f9154","resolution":{"observed_at":"2026-05-16T16:35:38.343282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Im2text: Describing images using 1 million captioned pho- tographs","venue":null,"work_id":"b3705b9f-e4a4-4462-8f82-c72f39745639","year":2011},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:c6caa36ed89cff0d80fde9937249629128090746cae4679878aae349e3ee647a","observation_id":"a241d2cc-0194-4612-b2e4-45821d294f5c","resolution":{"observed_at":"2026-05-16T16:35:38.344986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Episodic transformer for vision-and-language navigation","venue":null,"work_id":"5888fbed-8fcf-4cc0-a1e9-42b44bb34d40","year":2021},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:87b447a1e56629ec770a94187ac4bbc1ecf918c5ef369906ca349d35dc4eefac","observation_id":"9e0cdb38-0e3c-46b7-a3a2-d4724feb6298","resolution":{"observed_at":"2026-05-16T16:35:38.346786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tinyllama, Sep 2023","venue":null,"work_id":"6d2895a7-6c32-4647-bce0-5bd6cf5c570f","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:7ae3d642d33243a430db9115fe03b7ddfc782d6dac8a98a1cf958642926db606","observation_id":"57434338-5bc9-4041-984c-35b1187b4727","resolution":{"observed_at":"2026-05-16T16:35:38.196733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":"2306.14824","doi":"10.48550/arxiv.2306.14824","metadata_source":"pith","pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","venue":"cs.CL","work_id":"46e7f9e9-24c6-49af-b7d5-96159fa6f443","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:d372610d80b056bc73a375f8d39fa2dd3a7735766b53b66f5a1ab8246d3758af","observation_id":"ef5107f2-378f-4f46-8b3f-c2d406fe2129","resolution":{"observed_at":"2026-05-16T16:35:38.056229Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flickr30k entities: Collecting region-to-phrase corre- spondences for richer image-to-sentence models","venue":null,"work_id":"80fe1e07-10fb-41d2-9ccb-351eb9917889","year":2015},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:e438a90bc5479c7e5c1c1c2fc87790fb18f122d61c74dfadfb85f6e952159938","observation_id":"b120361c-df5d-463d-9cde-33f82eb435fc","resolution":{"observed_at":"2026-05-16T16:35:38.199106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring stochastic autoregressive im- age modeling for visual representation","venue":null,"work_id":"06c851e6-85a0-4a48-a86b-1a49f27d0b57","year":2074},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:76bde64c83605e920651cb862f4b813565b5839baf30e0dc7b4ae31846700299","observation_id":"5a5bd5a5-7d98-44b0-aa37-ad611722d250","resolution":{"observed_at":"2026-05-16T16:35:38.201294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"76fe6418-51ea-401d-b7fd-0694edbc1633","year":2021},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:f8b85be16c91a52a75ed0320ec07ed4450f9bbfb8cb6fa56f80df2a8ec153a76","observation_id":"23e90195-f4c2-4054-9de8-e3cb20e3aac9","resolution":{"observed_at":"2026-05-16T16:35:38.203485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":"5a37a21f-be93-48bc-8703-592d1840f1a8","year":2020},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:ffc52f5dd2332b041655d5e9e207fcaf6746a20b6ab419ec4c716766c01d2461","observation_id":"b2496a81-9dd4-4c1c-b9de-b3e600c5a2d6","resolution":{"observed_at":"2026-05-16T16:35:38.206091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepspeed: System optimizations enable training deep learning models with over 100 billion param- eters","venue":null,"work_id":"ff2be0cf-54c2-4f57-81de-5e48f36a81d9","year":2020},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:7ec64679ced52eeca0a92e673471e2c2ed137b18a022d4aa8caa8ff2108beb70","observation_id":"93002dfd-b06d-4bd0-9ad7-4d1f53fa3353","resolution":{"observed_at":"2026-05-16T16:35:38.209180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10972","last_updated":"2021-08-05T15:04:28Z","snapshot_observed_at":"2026-08-03T18:36:25.974390Z","submitted_at":"2021-04-22T10:10:14Z","title":"ImageNet-21K Pretraining for the Masses","version":4},"cited_work":{"arxiv_id":"2104.10972","doi":"10.48550/arxiv.2104.10972","metadata_source":"arxiv_reference","pith_arxiv_id":"2104.10972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Imagenet-21k pretraining for the masses","venue":"arXiv (Cornell University)","work_id":"31e88324-e013-43f0-8c70-24aba0fa92fb","year":2021},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2104.10972","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:2b35dc865bdf5eb53f38b4990d4688df9ea715a17d707711f6fe482a21a8735d","observation_id":"bdb84ae6-aeaf-49be-8af4-16da472a8658","resolution":{"observed_at":"2026-05-16T16:35:38.079877Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":40,"verified_fuzzy":58},"total_outbound_references":133},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 100 of 133 outbound references and 42 inbound Pith citation observations for arXiv:2312.16886."}