{"as_of":"2026-08-07T06:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fe61529d7da4365d027d1a1380c4bae9b340f2d4d2edaf567b01656cf6dd86a5","coverage":[{"denominator":129,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-23T22:20:21.427717Z","state":"measured"},{"denominator":147,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":147,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":47,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T06:02:30.164986Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T17:07:25.737454Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-07-10T17:07:25.737454Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","venue":"cs.CL","work_id":"4cf5f4e3-c59a-4ccb-a655-563157a9ce74","year":2024},"citing_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-16T02:56:41.658658Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2306.13549"},"observation_digest":"sha256:3fcdcae5c76172e53e717afddafc0f7df657c2b2781c9f45947f25a8cc7274ce","observation_id":"7f484300-e510-404c-b8f2-cf66eb5029db","resolution":{"observed_at":"2026-05-23T22:20:22.000193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-07-10T17:07:25.737454Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","venue":"cs.CL","work_id":"4cf5f4e3-c59a-4ccb-a655-563157a9ce74","year":2024},"citing_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-17T07:44:47.355960Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2403.18814"},"observation_digest":"sha256:ecdc7f782058aee87d64f3f2a293c0fb2c38fa9b3d6b17d87f089b02d1eae5e0","observation_id":"64a706b9-3249-4f6c-aa99-61d74a1960ea","resolution":{"observed_at":"2026-05-23T22:20:22.000193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-07-10T17:07:25.737454Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","venue":"cs.CL","work_id":"4cf5f4e3-c59a-4ccb-a655-563157a9ce74","year":2024},"citing_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T20:58:58.849040Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2404.16821"},"observation_digest":"sha256:3b7e17d61d8aa4f9dc0421e1ce3974d8df9454f096092093fc9b140c8628f901","observation_id":"0843e0c7-7283-4bf8-b8e7-4ace62ffb8b5","resolution":{"observed_at":"2026-05-23T22:20:22.000193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-07-10T17:07:25.737454Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","venue":"cs.CL","work_id":"4cf5f4e3-c59a-4ccb-a655-563157a9ce74","year":2024},"citing_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-17T00:05:03.547664Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2406.16860"},"observation_digest":"sha256:157f93c62b97534cb334d1703011190c54a0deb9dd5fbe9ef474d261e616b3af","observation_id":"e750d7f9-9365-4719-9f7d-3889b382ab3b","resolution":{"observed_at":"2026-05-23T22:20:22.000193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-07-10T17:07:25.737454Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","venue":"cs.CL","work_id":"4cf5f4e3-c59a-4ccb-a655-563157a9ce74","year":2024},"citing_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-04T22:09:42.241578Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-17T10:46:28.447347Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2407.03320"},"observation_digest":"sha256:fc2ba2c3174c7e7c90c1785118c9a4f61227ed55f89b415b7745089c3d23131c","observation_id":"57684e2e-a9c1-4d60-ab39-4700ec59b21a","resolution":{"observed_at":"2026-05-23T22:20:22.000193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-07-10T17:07:25.737454Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","venue":"cs.CL","work_id":"4cf5f4e3-c59a-4ccb-a655-563157a9ce74","year":2024},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:4199a0b788cf53e137ccbe034057b5fe82fa7afd917eee16c9cb9a9d5ab55e29","observation_id":"56e4d9ec-0f37-4b91-a8f7-79e175ca21f7","resolution":{"observed_at":"2026-05-23T22:20:22.000193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-07-10T17:07:25.737454Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","venue":"cs.CL","work_id":"4cf5f4e3-c59a-4ccb-a655-563157a9ce74","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:123b9b87b73165a1ae935a0037f27098e9ea7be6f0a780c276dfecd524a3a95e","observation_id":"19822b22-57b7-44b1-9d38-ca6665b1f39d","resolution":{"observed_at":"2026-05-23T22:20:22.000193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-07-10T17:07:25.737454Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","venue":"cs.CL","work_id":"4cf5f4e3-c59a-4ccb-a655-563157a9ce74","year":2024},"citing_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"reference_index":201,"source":"arxiv_source","source_observed_at":"2026-05-20T06:20:36.235304Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2408.04840"},"observation_digest":"sha256:cbe201be686c85d6305a70d664486f482b5a47bc93de1d231d8c7862407edc0b","observation_id":"188228ea-7320-4e61-9843-0f905066800c","resolution":{"observed_at":"2026-05-23T22:20:22.000193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-07-10T17:07:25.737454Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","venue":"cs.CL","work_id":"4cf5f4e3-c59a-4ccb-a655-563157a9ce74","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:867cc721dd427f8cc1d1059b031f1d3fa11a735041d9ec514fc25edc798a99a7","observation_id":"1b9acf5c-c89a-4316-912f-b40cbaa05b3a","resolution":{"observed_at":"2026-05-23T22:20:22.000193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-07-10T17:07:25.737454Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","venue":"cs.CL","work_id":"4cf5f4e3-c59a-4ccb-a655-563157a9ce74","year":2024},"citing_paper":{"arxiv_id":"2410.10594","last_updated":"2025-03-02T01:19:51Z","snapshot_observed_at":"2026-08-02T13:24:00.339129Z","submitted_at":"2024-10-14T15:04:18Z","title":"VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T15:37:25.781240Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2410.10594"},"observation_digest":"sha256:56d9e94be5529f12c469a936a2fe4d67402a8aff3d36733bd0850b69c27adc25","observation_id":"7c203caa-1a8f-46c5-b985-4fe3afd5b520","resolution":{"observed_at":"2026-05-23T22:20:22.000193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-07-10T17:07:25.737454Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","venue":"cs.CL","work_id":"4cf5f4e3-c59a-4ccb-a655-563157a9ce74","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:2ba8bb48ca183146536e65f6357e01bed04dbb9c36695987dc861867f9dbb6b9","observation_id":"12465fea-7643-4fdb-a10f-7759182e5100","resolution":{"observed_at":"2026-05-23T22:20:22.000193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-07-10T17:07:25.737454Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","venue":"cs.CL","work_id":"4cf5f4e3-c59a-4ccb-a655-563157a9ce74","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:5b90b176f912bce082a575feb64440a1ca108b542f71a80091db04ad3a92a979","observation_id":"60562b2e-a27c-4d56-b8c2-6b73887b1e0f","resolution":{"observed_at":"2026-05-23T22:20:22.000193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-07-10T17:07:25.737454Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","venue":"cs.CL","work_id":"4cf5f4e3-c59a-4ccb-a655-563157a9ce74","year":2024},"citing_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T10:09:21.542356Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2412.10302"},"observation_digest":"sha256:5751765d65c17bcac10c226e9f2d12c14efaa72b948bf9d1140a89369e127a20","observation_id":"8a85821c-0631-48c4-9033-01459026a816","resolution":{"observed_at":"2026-05-23T22:20:22.000193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-07-10T17:07:25.737454Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","venue":"cs.CL","work_id":"4cf5f4e3-c59a-4ccb-a655-563157a9ce74","year":2024},"citing_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-17T07:51:12.953777Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2412.14164"},"observation_digest":"sha256:50e64cf3a102c595509ec54fe01cff0a56b6971e5ff083f1c15594b1e36d4e4a","observation_id":"f0646d9d-8115-40e0-9c7f-0ae1c7abd54f","resolution":{"observed_at":"2026-05-23T22:20:22.000193Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-07-10T17:07:25.737454Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","venue":"cs.CL","work_id":"4cf5f4e3-c59a-4ccb-a655-563157a9ce74","year":2024},"citing_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T04:02:43.261543Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2501.00574"},"observation_digest":"sha256:229f518185dd35776c471a7a755a1773bed281b110665ad1d90abc1511fd4b53","observation_id":"7311a77c-640e-4ac4-9681-d6e43ef63cfe","resolution":{"observed_at":"2026-05-23T22:20:22.000193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-07-10T17:07:25.737454Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","venue":"cs.CL","work_id":"4cf5f4e3-c59a-4ccb-a655-563157a9ce74","year":2024},"citing_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-17T02:52:20.643070Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2501.12386"},"observation_digest":"sha256:0c1191d7ae0a6ee461cf946fca0532d2c7d5885069b9f5df4707cf0357a51ed1","observation_id":"be7b2f50-db56-46cf-a2b5-3f3ee2c0b42b","resolution":{"observed_at":"2026-05-23T22:20:22.000193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-07-10T17:07:25.737454Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","venue":"cs.CL","work_id":"4cf5f4e3-c59a-4ccb-a655-563157a9ce74","year":2024},"citing_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-23T02:25:04.405036Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2502.13923"},"observation_digest":"sha256:683421867727908b9ad1ce71ee4c57b94d5abfd69c27c6e4728f123fb7166351","observation_id":"29948f7d-4168-40ed-9555-073fad16b4fd","resolution":{"observed_at":"2026-05-23T22:20:22.000193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-07-10T17:07:25.737454Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","venue":"cs.CL","work_id":"4cf5f4e3-c59a-4ccb-a655-563157a9ce74","year":2024},"citing_paper":{"arxiv_id":"2504.09925","last_updated":"2026-04-29T06:12:36Z","snapshot_observed_at":"2026-08-02T07:57:37.201421Z","submitted_at":"2025-04-14T06:33:29Z","title":"FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T19:49:00.961388Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2504.09925"},"observation_digest":"sha256:5ba4221047bc15a7b2c6cd64ec2f2f8803fb11710f483228c2c7d5bfe96967f2","observation_id":"b8c5d58f-23a4-4a3e-9389-833e49223ddb","resolution":{"observed_at":"2026-05-23T22:20:22.000193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-07-10T17:07:25.737454Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","venue":"cs.CL","work_id":"4cf5f4e3-c59a-4ccb-a655-563157a9ce74","year":2024},"citing_paper":{"arxiv_id":"2506.04565","last_updated":"2026-05-08T15:50:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-05T02:34:43Z","title":"From Standalone LLMs to Integrated Intelligence: A Survey of Compound Al Systems","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-19T11:49:36.574471Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2506.04565"},"observation_digest":"sha256:c4b0d18ef7205169e774c8a81d90318eeaff6499a1476ade15da1414dde098d5","observation_id":"09d2fd83-eeef-4386-bd3f-8c938035f13b","resolution":{"observed_at":"2026-05-23T22:20:22.000193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-07T06:02:30.164986Z","title":"H., Chen, S., Zhang, R., Chen, J., Wu, X., Zhang, Z., Chen, Z., Li, J., Wan, X., and Wang, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.164986Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:29a6e66d0590739dcf97231d4cfea538a9e6ab13ee408c991f0c37ec02d7f8b3","observation_id":"e07abd60-3b54-47fa-9573-77bf4aa61664","resolution":{"observed_at":"2026-08-07T06:02:30.164986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-07T05:01:18.298970Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08927","last_updated":"2025-06-10T15:51:16Z","snapshot_observed_at":"2026-08-07T04:56:37.300638Z","submitted_at":"2025-06-10T15:51:16Z","title":"Socratic-MCTS: Test-Time Visual Reasoning by Asking the Right Questions","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T05:01:18.298970Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2506.08927"},"observation_digest":"sha256:fac4ba2611963841f4fc51a81b0b264416d8a335c9fd90ff4b2be470329a17af","observation_id":"456b7eb9-df18-4fee-81a1-718122d047f6","resolution":{"observed_at":"2026-08-07T05:01:18.298970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-06T23:28:02.771576Z","title":"Allava: Harnessing gpt4v-synthesized data for lite vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-06T23:20:59.622434Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:02.771576Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:8c05a58818ad35a80ee1cb875d6a3dd6cb6d5fcf823a4a08cd83b82fceeadd02","observation_id":"eac4d61d-d032-4427-a682-7161337aadda","resolution":{"observed_at":"2026-08-06T23:28:02.771576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-06T21:27:38.026930Z","title":"Allava: Harnessing gpt4v-synthesized data for lite vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-06T21:21:48.354626Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:38.026930Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:8958050aa41abac51e4cdbae61fc53ba81a55cc6f970076d9998878cdbc2ad2e","observation_id":"f09fa8bd-6a5a-4514-a61f-37094c21544b","resolution":{"observed_at":"2026-08-06T21:27:38.026930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-06T18:24:26.584334Z","title":"Allava: Harness- ing gpt4v-synthesized data for a lite vision-language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:26.584334Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:8e38b94cb162263a3cf47a6917c02de1ce0dd92b2ae8e6d912d22d58537ec7a3","observation_id":"c74c8ca2-29e0-459b-8ba7-1b55b8ab2e6c","resolution":{"observed_at":"2026-08-06T18:24:26.584334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-06T16:50:05.268162Z","title":"Allava: Harnessing gpt4v-synthesized data for a lite vision-language model,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:05.268162Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:05bab3a984b03198d007f0a818c15cc1c53ecb7b7e8573378d7c16b111031206","observation_id":"244696a9-e355-4869-9b6a-18fa1cf73075","resolution":{"observed_at":"2026-08-06T16:50:05.268162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-06T15:33:42.059251Z","title":"Allava: Harnessing gpt4v-synthesized data for lite vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:42.059251Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:af9d0d88dfbc5142f9431b9a11191dc2bab81c7d4f03233566b1da4b2a3c3c9b","observation_id":"ae659049-9bdc-4c7c-a9a9-ae018ab13db5","resolution":{"observed_at":"2026-08-06T15:33:42.059251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-06T12:31:26.035221Z","title":"Allava: Harnessing gpt4v-synthesized data for a lite vision-language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.035221Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:edd0c32a307f3474e104e44db2127f73826cea20291e42837b05c6b3bfdcce50","observation_id":"bc5c1853-1c5a-4793-94e1-21bd4be5d566","resolution":{"observed_at":"2026-08-06T12:31:26.035221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-06T12:12:23.530239Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22003","last_updated":"2025-07-30T04:41:52Z","snapshot_observed_at":"2026-08-06T12:12:22.990814Z","submitted_at":"2025-07-29T16:53:27Z","title":"See Different, Think Better: Visual Variations Mitigating Hallucinations in LVLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T12:12:23.530239Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2507.22003"},"observation_digest":"sha256:35adfb7ddad8f7989bc957128b9ae5559d267bbe8949e1d821ffcf91c030fa96","observation_id":"70656234-ccfe-4790-b2aa-9f3d34e43bcd","resolution":{"observed_at":"2026-08-06T12:12:23.530239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-05T20:31:38.690498Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10339","last_updated":"2025-08-14T04:48:38Z","snapshot_observed_at":"2026-08-06T22:13:56.912419Z","submitted_at":"2025-08-14T04:48:38Z","title":"Concepts or Skills? Rethinking Instruction Selection for Multi-modal Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:38.690498Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2508.10339"},"observation_digest":"sha256:086b7f06182589e5c4148ac624a21b3b0cd37e5a3a0b6fb617bd57db4b10fc65","observation_id":"9c68df4a-2ce6-4e09-9029-597b53eeb8ae","resolution":{"observed_at":"2026-08-05T20:31:38.690498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-05T14:03:34.344201Z","title":"Allava: Harnessing gpt4v- synthesized data for lite vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21767","last_updated":"2025-08-29T16:40:57Z","snapshot_observed_at":"2026-08-06T03:24:39.373354Z","submitted_at":"2025-08-29T16:40:57Z","title":"UItron: Foundational GUI Agent with Advanced Perception and Planning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:34.344201Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2508.21767"},"observation_digest":"sha256:6e2860525d3145cef1cc4783330ff3bcdc2fc98d6f2e7830af9c17791026e9a8","observation_id":"0f65a0b2-c7f3-4021-9f79-277a0b1b0540","resolution":{"observed_at":"2026-08-05T14:03:34.344201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-04T18:57:10.308113Z","title":"Allava: Harnessing gpt4v-synthesized data for a lite vision-language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09555","last_updated":"2025-09-11T15:43:54Z","snapshot_observed_at":"2026-08-04T18:57:06.057684Z","submitted_at":"2025-09-11T15:43:54Z","title":"InterAct: Advancing Large-Scale Versatile 3D Human-Object Interaction Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T18:57:10.308113Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2509.09555"},"observation_digest":"sha256:b743e22950a326b40d8ef6a5b10aa7b744c471d5f5c430dbfbfe9045dbdf96cf","observation_id":"11029495-1e23-44bf-945f-aa1297ea12f3","resolution":{"observed_at":"2026-08-04T18:57:10.308113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-03T11:28:05.491861Z","title":"arXiv preprint arXiv:2402.11684 (2024) 3","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.06550","last_updated":"2026-07-22T15:20:13Z","snapshot_observed_at":"2026-08-06T23:57:51.136833Z","submitted_at":"2026-01-10T12:18:12Z","title":"Generative Semantic Multi-Object Tracking: A Large-Scale Benchmark and an MLLM-Driven Reasoning Framework","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T11:28:05.491861Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2601.06550"},"observation_digest":"sha256:42f16e22b6d2288bb55cc52dc1b743e6c0cab98fcaea2d55965ab203e265f507","observation_id":"3142315b-10aa-4957-acab-53d14926c21f","resolution":{"observed_at":"2026-08-03T11:28:05.491861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-07-10T17:07:25.737454Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","venue":"cs.CL","work_id":"4cf5f4e3-c59a-4ccb-a655-563157a9ce74","year":2024},"citing_paper":{"arxiv_id":"2605.10641","last_updated":"2026-05-11T14:28:44Z","snapshot_observed_at":"2026-07-06T23:22:32.858399Z","submitted_at":"2026-05-11T14:28:44Z","title":"LLaVA-CKD: Bottom-Up Cascaded Knowledge Distillation for Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T05:10:56.991368Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2605.10641"},"observation_digest":"sha256:e0a3e1cecc5c4635a7e9b1fb43058a50266556308134dd20b8af152808d6c4e4","observation_id":"d1b0a231-d878-4ea6-b605-325350dca75e","resolution":{"observed_at":"2026-05-23T22:20:22.000193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-07-10T17:07:25.737454Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","venue":"cs.CL","work_id":"4cf5f4e3-c59a-4ccb-a655-563157a9ce74","year":2024},"citing_paper":{"arxiv_id":"2605.14530","last_updated":"2026-05-19T00:58:43Z","snapshot_observed_at":"2026-07-06T23:25:58.895612Z","submitted_at":"2026-05-14T08:11:32Z","title":"Mitigating Mask Prior Drift and Positional Attention Collapse in Large Diffusion Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T02:14:59.487486Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2605.14530"},"observation_digest":"sha256:05f10f662e46ed2868d248948bf2624a781825469774511a892fa7b48fc34787","observation_id":"ca2f9252-a0b9-4afb-acd6-f99770275511","resolution":{"observed_at":"2026-05-23T22:20:22.000193Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-07-10T17:07:25.737454Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","venue":"cs.CL","work_id":"4cf5f4e3-c59a-4ccb-a655-563157a9ce74","year":2024},"citing_paper":{"arxiv_id":"2605.14530","last_updated":"2026-05-19T00:58:43Z","snapshot_observed_at":"2026-07-06T23:25:58.895612Z","submitted_at":"2026-05-14T08:11:32Z","title":"Mitigating Mask Prior Drift and Positional Attention Collapse in Large Diffusion Vision-Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T21:47:32.112057Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2605.14530"},"observation_digest":"sha256:c9af9f938c1a7db7b8af671f15157bf1d712716dd6dc18180636641d68c2506c","observation_id":"f32c4e1f-9cd0-415c-9197-f90f2246059a","resolution":{"observed_at":"2026-05-23T22:20:22.000193Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-07-10T17:07:25.737454Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","venue":"cs.CL","work_id":"4cf5f4e3-c59a-4ccb-a655-563157a9ce74","year":2024},"citing_paper":{"arxiv_id":"2605.20033","last_updated":"2026-05-19T15:54:22Z","snapshot_observed_at":"2026-07-06T23:30:39.512029Z","submitted_at":"2026-05-19T15:54:22Z","title":"A Nash Equilibrium Framework For Training-Free Multimodal Step Verification","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-20T06:10:36.290559Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2605.20033"},"observation_digest":"sha256:ebd6c62dcd0d9624e0a79a181c602beae72ab5a441543c87092f8aed326a6429","observation_id":"0345c5d3-e620-41ad-85ae-c1afd9c177e1","resolution":{"observed_at":"2026-05-23T22:20:22.000193Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-07-10T17:07:25.737454Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","venue":"cs.CL","work_id":"4cf5f4e3-c59a-4ccb-a655-563157a9ce74","year":2024},"citing_paper":{"arxiv_id":"2605.28023","last_updated":"2026-05-27T06:27:04Z","snapshot_observed_at":"2026-08-02T21:20:31.316522Z","submitted_at":"2026-05-27T06:27:04Z","title":"VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T13:13:57.599970Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2605.28023"},"observation_digest":"sha256:3d2e3964e7a14d14156ebc3081875ac57917903c6d3e6435837583f96332068a","observation_id":"6b6c3cf9-6943-450e-be68-f3ad21c67230","resolution":{"observed_at":"2026-06-29T13:23:28.499217Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-07-10T17:07:25.737454Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","venue":"cs.CL","work_id":"4cf5f4e3-c59a-4ccb-a655-563157a9ce74","year":2024},"citing_paper":{"arxiv_id":"2606.09393","last_updated":"2026-06-08T12:09:20Z","snapshot_observed_at":"2026-07-06T23:48:44.159537Z","submitted_at":"2026-06-08T12:09:20Z","title":"CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T17:21:38.543724Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2606.09393"},"observation_digest":"sha256:1709add2c8559d2721dfc03125317cc9e30001e01de9ca7c65dd50c2077a0803","observation_id":"bf538334-bcce-42a9-92c9-b16a4252d183","resolution":{"observed_at":"2026-07-03T00:17:29.051154Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-07-10T17:07:25.737454Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","venue":"cs.CL","work_id":"4cf5f4e3-c59a-4ccb-a655-563157a9ce74","year":2024},"citing_paper":{"arxiv_id":"2606.28551","last_updated":"2026-06-30T20:49:34Z","snapshot_observed_at":"2026-08-02T23:02:11.703134Z","submitted_at":"2026-06-26T19:11:29Z","title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T01:16:16.834861Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2606.28551"},"observation_digest":"sha256:e8eced110753672a706c40b50600565b754e22065759a5645223c4a039241b9d","observation_id":"0b6e4a42-02b3-4b5c-98df-dfa2c8b94edc","resolution":{"observed_at":"2026-07-01T15:45:47.633263Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-07-10T17:07:25.737454Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","venue":"cs.CL","work_id":"4cf5f4e3-c59a-4ccb-a655-563157a9ce74","year":2024},"citing_paper":{"arxiv_id":"2606.28551","last_updated":"2026-06-30T20:49:34Z","snapshot_observed_at":"2026-08-02T23:02:11.703134Z","submitted_at":"2026-06-26T19:11:29Z","title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-02T21:10:10.548489Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2606.28551"},"observation_digest":"sha256:d4db1c07ce3a05fbb50735015469965ac919432fb76f25a9dcd7f4ff15c57dd5","observation_id":"6d30b0ad-a591-435d-953b-7ea19ac1832f","resolution":{"observed_at":"2026-07-02T21:17:24.218321Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-07-10T17:07:25.737454Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","venue":"cs.CL","work_id":"4cf5f4e3-c59a-4ccb-a655-563157a9ce74","year":2024},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-06T18:54:59.892186Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-10T17:02:28.089092Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:42a2d8c2cc4df05177814afc10c016813832c5ec8470f18aa1a8f4439cea7fc1","observation_id":"9bf5078f-b318-4c00-bc21-b63c3a4982a1","resolution":{"observed_at":"2026-07-10T17:07:25.738616Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-02T08:03:52.279708Z","title":"ALLaV A: Harnessing gpt4v-synthesized data for lite vision-language models.arXiv preprint arXiv:2402.11684, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-06T18:54:59.892186Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:52.279708Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:6f49aae6edf349b4b68273ad1624efe6f75c303570339998daef7aba9e622a44","observation_id":"d9ce6021-0736-4b19-8f31-9f19cda1160a","resolution":{"observed_at":"2026-08-02T08:03:52.279708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-01T14:39:52.571104Z","title":"arXiv preprint arXiv:2402.11684 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18709","last_updated":"2026-07-22T05:33:17Z","snapshot_observed_at":"2026-08-04T15:25:40.989347Z","submitted_at":"2026-07-21T05:05:01Z","title":"RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation","version":2},"reference_index":277,"source":"arxiv_source","source_observed_at":"2026-08-01T14:39:52.571104Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2607.18709"},"observation_digest":"sha256:b329e7066bb0b4f6f3c23f720c37bc5dbe3a8e2750ad770acc57d3849c982f52","observation_id":"f52ac92f-c83b-4782-94bf-78228e7463b5","resolution":{"observed_at":"2026-08-01T14:39:52.571104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-01T04:30:12.392735Z","title":"arXiv preprint arXiv:2402.11684 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22531","last_updated":"2026-07-24T17:59:39Z","snapshot_observed_at":"2026-08-01T04:29:41.388158Z","submitted_at":"2026-07-24T17:59:39Z","title":"Twins: Learn to Predict Unified Representations with Focal Loss","version":1},"reference_index":292,"source":"arxiv_source","source_observed_at":"2026-08-01T04:30:12.392735Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2607.22531"},"observation_digest":"sha256:441cbaee89f904cc4edb8841489b0b0e0a5544eed89a2b432804983db57043ed","observation_id":"d0da804b-bc58-427f-b0a9-b877b11f34f1","resolution":{"observed_at":"2026-08-01T04:30:12.392735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-01T16:31:11.411882Z","title":"ALLaV A: Harnessing GPT4V-Synthesized Data for a Lite Vision-Language Model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-02T14:43:28.084412Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.411882Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:0b535fbc34b1c8fdd86b26bbd82d0ac33385cb5ab623b53e819d242fd1169ede","observation_id":"fc030710-7f3d-4c6a-9c50-c2a7651aeed0","resolution":{"observed_at":"2026-08-01T16:31:11.411882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-07-31T06:20:30.121328Z","title":"Allava: Harnessing gpt4v-synthesized data for lite vision-language models.arXiv preprint arXiv:2402.11684, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24743","last_updated":"2026-07-28T10:52:57Z","snapshot_observed_at":"2026-08-02T13:25:41.124239Z","submitted_at":"2026-07-27T17:59:49Z","title":"ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding","version":2},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:30.121328Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2607.24743"},"observation_digest":"sha256:7926756c3949da56dc09462efffd03ad5aab9d3aff2d4c7f169054670515f2e3","observation_id":"c14cd281-c78b-4d79-8b87-cbae69fe064e","resolution":{"observed_at":"2026-07-31T06:20:30.121328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-01T02:14:09.761937Z","title":"arXiv preprint arXiv:2402.11684 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.761937Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:b04b1295389eb3082d9d07f1398a7745fa9b9b49e61b37e139391efddbf9b56e","observation_id":"ee0a4277-ee5e-4f3e-ba16-6697ec990925","resolution":{"observed_at":"2026-08-01T02:14:09.761937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.11684/citation-record","integrity":"/paper/2402.11684/integrity","json":"/paper/2402.11684/citation-record.json","paper":"/paper/2402.11684"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T21:46:35.414377Z","title":"2023 , eprint=","venue":null,"work_id":"9d36fd9e-3725-46a0-8328-1c02aa8539da","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:1dbd3a0ec8e6b6e2ac164e63333b548cb947779ba266ff4ec576d8c50151c321","observation_id":"9d2d683a-73e5-49f9-aecc-1b27beacc083","resolution":{"observed_at":"2026-05-23T22:20:21.924640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"3566849b-f329-43ed-adca-85da4fb4b70a","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:7943c1bbfdf3fc94f4ebf5c8403c171593bea950ede236c67e3f717a79faa2d6","observation_id":"c2537725-e74f-4c91-8305-e37a9d132f3a","resolution":{"observed_at":"2026-05-23T22:20:21.969058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"e45bd25b-bfc9-4b50-a25e-3b47db7b12e3","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:181fd0b287fc71dd71bdc0c2a6a387b7544ca586f174843922098cfe8db27d22","observation_id":"491845b6-90d9-44ed-b7b6-947560ba8a38","resolution":{"observed_at":"2026-05-23T22:20:21.972356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"26308fc4-ebab-40aa-b019-467f363614ef","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:40c18169c44a8a51b23b9dd5a82d1649f5ba477720793c6a367f4989fca2c20f","observation_id":"e7294995-6413-44a0-ac14-6c1f788230f3","resolution":{"observed_at":"2026-05-23T22:20:21.975254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"257dbdd4-55b5-422a-85eb-0681e8654208","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:cab812e5d58ec0e142d513cf54861555e667dce126c24aee2d0dd741e5f9679f","observation_id":"e6b9af04-0852-4d05-8783-832f9e0234f0","resolution":{"observed_at":"2026-05-23T22:20:21.978398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"4f5e019d-fe71-4715-87f6-56fbfc47ffcb","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:5af8077bf95aa53f2fa3f900a244daf61a0d78662865fbadf75a7625e212564a","observation_id":"c7096c37-3649-4320-af67-c54aba6502b0","resolution":{"observed_at":"2026-05-23T22:20:21.980983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing our Multimodal Models , url =","venue":null,"work_id":"06741906-5f6f-47d6-9d6c-254b17a2d668","year":null},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:03793c3c26620addcab32be92346811de9d513d80d9b6b1bb462c03b9b248c1b","observation_id":"2b775ada-2493-4478-9f65-54978b561c9a","resolution":{"observed_at":"2026-05-23T22:20:21.984180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , howpublished =","venue":null,"work_id":"fcb578ba-10f9-47ab-95aa-82fbdb5f7b79","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:5451d298ff9d257078787ec66b6472956d4449eb54b7d64f99c87e2df8dd4ea7","observation_id":"8a57a259-5d04-4df7-8fe9-a9a1f15f1fd3","resolution":{"observed_at":"2026-05-23T22:20:21.987109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c0504491-d17e-4eb3-9e06-8d64b97168a2","year":null},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:b058bb22ab93989885bbacda068085c8d3fec76ba30d674295e63ef112f2e847","observation_id":"4041ad40-fa85-4071-92f4-61c4401e36b7","resolution":{"observed_at":"2026-05-23T22:20:21.989872Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision-Flan:Scaling Visual Instruction Tuning , url =","venue":null,"work_id":"942e1bd8-dcba-41a2-a810-4e9f7abad028","year":null},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:0295d1ba78953f2362affb971291763e2314b6eff396e94a60f59cace1c486dc","observation_id":"81503d65-50e5-4020-b37f-944af054eb09","resolution":{"observed_at":"2026-05-23T22:20:21.993173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11206","last_updated":"2023-05-18T17:45:22Z","snapshot_observed_at":"2026-07-06T15:29:24.259073Z","submitted_at":"2023-05-18T17:45:22Z","title":"LIMA: Less Is More for Alignment","version":1},"cited_work":{"arxiv_id":"2305.11206","doi":"10.48550/arxiv.2305.11206","metadata_source":"pith","pith_arxiv_id":"2305.11206","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LIMA: Less Is More for Alignment","venue":"cs.CL","work_id":"3986a077-ad54-4cba-bd8f-914fe1862115","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"cited_paper":"/paper/2305.11206","citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:ee49585db4d78ad0c2f54632a6b4ac0a8d7059e4799001e33d9204fbe15d671b","observation_id":"44388c28-940f-4b21-a68e-ae5388db61f2","resolution":{"observed_at":"2026-05-23T22:20:21.561755Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2022 , eprint=","venue":null,"work_id":"fc5505f6-c312-4d94-9e87-a540a906b372","year":2022},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:6429b947bbe622c0c0f8d749b51767550b61159c6f5a3140faf925c92d8d6bac","observation_id":"b2b65ead-b4b2-4f62-92f4-f60724531658","resolution":{"observed_at":"2026-05-23T22:20:21.996128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2022 , eprint=","venue":null,"work_id":"dfa5a78b-75f0-4db4-ab41-47652950d2b6","year":2022},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:4cf785c554c7707e59d31a544d7d7853b38fa4b9031d1fddf14e76f5bb88ae5a","observation_id":"653a7255-9f02-4f2c-a643-a9efa08ca86d","resolution":{"observed_at":"2026-05-23T22:20:21.999078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"b713e1fe-cf9c-4608-875e-124790f21dea","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:daf55bd430b0aa316f3a0270ef400169e0d4cf9b37d64825e4a45da485050404","observation_id":"ac03eb89-2e31-478d-b1de-444eba8ecece","resolution":{"observed_at":"2026-05-23T22:20:21.579450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"2a233147-17ae-4a84-a51a-aeaa6303e8e1","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:8b5b4d9ca06b6e588eabf3edea1e3d3a6a569cffee5fb546ba23c30c31f0a926","observation_id":"2bb80d9b-327a-430c-b4f4-cc186303cd69","resolution":{"observed_at":"2026-05-23T22:20:21.583650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T19:06:28.464082Z","title":"2015 , eprint=","venue":null,"work_id":"8a76def7-ff24-48d4-a3e3-841e76827354","year":2015},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:dea0ea09cf4ebb741fd34888dc00424f8de071792dd03c3bb4ab12134dc0ff21","observation_id":"5529c882-0365-40af-b32a-025c0c678ceb","resolution":{"observed_at":"2026-05-23T22:20:21.587726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2016 , eprint=","venue":null,"work_id":"7ad1e9a1-11d1-4415-9075-16173a2e52f1","year":2016},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:7927adf3a332026aebb6e5b23d60b9a8560da8f701355f2ce845151ed964c748","observation_id":"2761e794-4eee-4be3-8331-a62df4cd818a","resolution":{"observed_at":"2026-05-23T22:20:21.592062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2019 international conference on document analysis and recognition (ICDAR) , pages=","venue":null,"work_id":"c53c35d3-1791-4921-8d13-d4f9569af1d0","year":2019},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:68a708fd1b16615b921f80a46c514affde1d846e4b685fa7eaf1f3c6ee3a531c","observation_id":"9a364230-b94b-4b0c-824b-194c81bb0575","resolution":{"observed_at":"2026-05-23T22:20:21.595577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":"ffc89398-ba7c-4918-86c2-ff642d2731f8","year":null},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:9f11ae8a47f545ccb41c92c1911419000913336df5fbbbf34b39742324680663","observation_id":"f7de95bf-1e31-4817-9aa5-654de6c00192","resolution":{"observed_at":"2026-05-23T22:20:21.599458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2019 , eprint=","venue":null,"work_id":"dd631d54-8dbc-4d9f-bd57-f972ca4e252c","year":2019},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:63c5671aab0ec561d7599dfe78e11439c0753beabaab69f5bd9929602b6d2547","observation_id":"f314c186-052f-4e68-b298-b7de2e46e4c9","resolution":{"observed_at":"2026-05-23T22:20:21.602734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"729ba6ee-c079-4a39-af49-0e43f7177a7c","year":2024},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:356733144918c09367432fd2896ad2c9ea676cffa5865641f7b60fe970403455","observation_id":"b52e2ce0-e127-4caf-a304-db723afd055f","resolution":{"observed_at":"2026-05-23T22:20:21.606652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2021 , eprint=","venue":null,"work_id":"6679f5fd-3cd4-410c-86fd-9e4b8f19c52e","year":2021},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:47d80a672331302afc37b1f6a9a08ac5c0cdf4e9c1749ca755ff726665717fe8","observation_id":"e66aa8fc-b5a2-4309-9f2b-451c59ba5630","resolution":{"observed_at":"2026-05-23T22:20:21.610156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":"4e2a3b7a-6ad4-4499-88f5-d2d0acac58ce","year":null},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:118672b9c0afbcf2df57ce0c37ec5993455b8500a3017f90abf445e20b3cc3af","observation_id":"f2d30a15-bf42-4802-8f6a-bf172d9396f8","resolution":{"observed_at":"2026-05-23T22:20:21.620429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2021 , eprint=","venue":null,"work_id":"ef2eeb79-e13c-420d-bb34-840eb4abd7e5","year":2021},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:a90f486a994b5befb8e50db8c34ba735fc5661f7d0b0e39e6af8d071ced31d9c","observation_id":"342c2df9-f52d-4545-b04a-326a3135fb98","resolution":{"observed_at":"2026-05-23T22:20:21.624409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"7c9be260-b396-4913-8495-7b9264c28837","year":null},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:591b2b0f280700c136073cddea1b9fe899e6215b29f2aae2e2158ad3ddfcf302","observation_id":"b15b2755-52d0-4faf-9afd-3eeea75888bf","resolution":{"observed_at":"2026-05-23T22:20:21.628255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"39737bad-43cf-4dd5-9236-6caccb5fe497","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:467505c7bc534785f2eab161e3b70207516a418c55b3eb518b7be6f101e558c2","observation_id":"31dbce92-e27c-4df3-95d2-a976e0054382","resolution":{"observed_at":"2026-05-23T22:20:21.632109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:46:21.705249Z","title":"2024 , eprint=","venue":null,"work_id":"ca5f5ecd-9b5c-411b-8448-7cfb2d5f5eb7","year":2024},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:2b4b7ac60107f55c33395b831e723123db68a9ad03b30d8dd42270eb3bccf7ee","observation_id":"ec4803c7-c36e-40f4-8e98-0077178dccf5","resolution":{"observed_at":"2026-05-23T22:20:21.635823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T19:06:27.880303Z","title":"2023 , eprint=","venue":null,"work_id":"8a1e4cb7-b339-4ab3-a5b3-604af3598ddb","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:48fe9c510ab6948334a2831e35060f7f01c85574e51c8d00e39f03116a271416","observation_id":"6c41fa27-360f-4d73-a9e6-ac8b34d64a29","resolution":{"observed_at":"2026-05-23T22:20:21.639697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"29ba4248-0750-4363-8541-3d092bcad71e","year":2024},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:6529e0df7306c234a73656cf75f773dad8095686e0bf98950d0ade6b4872e8b9","observation_id":"d678331f-1226-4d5f-ab12-1497f4f11b06","resolution":{"observed_at":"2026-05-23T22:20:21.643190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:58:01.172438Z","title":"2023 , eprint=","venue":null,"work_id":"53c14a9a-1148-4535-9504-f61acdc43fb9","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:87f75d3f6a25d9e54b9daa5442e026e313d76f54809e2ff61c1dbc914f97ac28","observation_id":"9c763088-936e-4117-846d-c9005c092b69","resolution":{"observed_at":"2026-05-23T22:20:21.647196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a0aeb182-924d-452c-af5b-b178a3e7c391","year":null},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:a75fb2ef924129adeaede63d631e353646778eaac207f72ee706aabce4d89eb0","observation_id":"64bb3308-17a0-4d28-a27d-974286800dde","resolution":{"observed_at":"2026-05-23T22:20:21.650231Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"123437f5-e667-445b-ad2c-440d080d941e","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:71fddc4ffdbb6cc1f5b06a5bc7d60e87d3b409534fa7a45c85efb55366b16d57","observation_id":"03275804-3167-4c0a-b26e-f08b8cd5cde8","resolution":{"observed_at":"2026-05-23T22:20:21.653987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T15:05:03.616349Z","title":"2023 , eprint=","venue":null,"work_id":"aab8e5ca-8400-45a9-a93f-72a6e7d231da","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:160d4ea2a98931e231fcfba7f29726365db9aa3edad98feaff43dd1ab7ef1338","observation_id":"640d4cdc-74d0-4c4a-ad7f-02a9c05bccd6","resolution":{"observed_at":"2026-05-23T22:20:21.657674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"69d82ac5-4635-4335-9686-c44503407be8","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:ab49eaf60ff76afde623643cdd48faa03084089ae2e19503ee9b544696bd335e","observation_id":"77284240-dda2-46c6-9465-5f2bcf952931","resolution":{"observed_at":"2026-05-23T22:20:21.661012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"d71cd7f9-5935-4804-947b-745f7d738aa5","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:ed24a40f39d86a77549d1bdda8df103a7a94453523072df1b7bc251c4afeb1a5","observation_id":"20e6a517-f5e9-496e-a7ea-2e883cc060cc","resolution":{"observed_at":"2026-05-23T22:20:21.664482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"4478566d-c0ed-407b-870a-9940c36e6fef","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:230246b3339682cb9f58ff6f0713f43cc02d5a2a96c4e5e6982ba41afe68a6f8","observation_id":"ea12edbe-a67f-4603-917b-44961e0e5a4c","resolution":{"observed_at":"2026-05-23T22:20:21.668136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"56dd24a5-a141-4b65-9be8-f06db24fd710","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:f16d80adae638c2737af716f72baeb3ffef0945eee03f7552fda8ca02f978e39","observation_id":"fe31deec-7e16-4f6e-ab73-c43d7230412d","resolution":{"observed_at":"2026-05-23T22:20:21.671283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T19:36:29.944605Z","title":"2021 , eprint=","venue":null,"work_id":"01eb26fa-b178-499b-bc7b-b2ff5dd67b24","year":2021},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:1cebfd28e67b34732a8915878670c1f569d042c21c61c76f8c81a173af42ef59","observation_id":"08637f11-df65-4b36-96e4-e25aee153dca","resolution":{"observed_at":"2026-05-23T22:20:21.674153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T12:46:14.993402Z","title":"2021 , eprint=","venue":null,"work_id":"2bf5e215-aa95-4dba-89bd-c7c2b236f443","year":2021},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:9a2b37a4627ef54e0d1c2d2729a91773fedb81d0f42dfc1b5313b85c3561af4a","observation_id":"cccad769-eb23-4b6a-ae05-73e822704d42","resolution":{"observed_at":"2026-05-23T22:20:21.677836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T12:46:15.104674Z","title":"2021 , eprint=","venue":null,"work_id":"0d46a05b-859d-423c-ae95-e7bb4f120561","year":2021},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:2dae789924e377475664edcb363cc94db5d0af8b0e9bea39863a1d6ab7158a1a","observation_id":"2867262c-0806-431e-a96e-d69978d76030","resolution":{"observed_at":"2026-05-23T22:20:21.681685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:42:40.348897Z","title":"and Stoica, Ion and Xing, Eric P","venue":null,"work_id":"cb4b41f6-6d60-4db4-a4d1-6c5bb7899473","year":null},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:5ce6e41f22795d7eb44bc67d992cd3c82dbdaaa2e5cc4a8386ddfbe6babb45c6","observation_id":"81396910-be46-42da-a8bd-6562720adabe","resolution":{"observed_at":"2026-05-23T22:20:21.685194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2022 , eprint=","venue":null,"work_id":"77255a3a-8a03-4502-9fc5-63342cd4b9e3","year":2022},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:6f7f1c2e04881f32f158e5870901ac1707d95cced2bbcb03c1083e002737c777","observation_id":"2c88cf11-40d6-4f60-b450-75541e1df7d2","resolution":{"observed_at":"2026-05-23T22:20:21.688017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"881cb89c-21f4-4ee6-872f-39607355459b","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:761c0fdea33a09aee2e580c45933a00e2db75b8b0be0cb2004f83023a45369b0","observation_id":"d8512e99-c20c-4292-8635-f9e2904e77ad","resolution":{"observed_at":"2026-05-23T22:20:21.691395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"926f57fa-1f0d-4a06-bcb0-7b3ce8110ce6","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:ddc4da9fe1f8c234facf57519ecfd870002d2611a32dbc2aa371bec11d8a2bda","observation_id":"2a90798a-c33c-488b-95ab-a06655f2fa64","resolution":{"observed_at":"2026-05-23T22:20:21.695671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"fb2f969d-ffd7-4b95-b338-077cf76c83ad","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:44482446db86885a533a84f37b7167f5d7afc3effdd819865d4dd192c011246e","observation_id":"42b7c44c-d132-4065-8939-01ec6b74359d","resolution":{"observed_at":"2026-05-23T22:20:21.699400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"a5e19617-852c-4288-bc94-ccad21dcbee7","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:111f6c9f3908bc2d9d68034c7efce462c077c8c57a60ce5a565cfdd046d0fe7c","observation_id":"95697ec4-af41-44c1-a16f-2cf994274dea","resolution":{"observed_at":"2026-05-23T22:20:21.705715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"3ff39e6a-ffad-4166-8fa4-32d72d12e945","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:e1dbe72094a30d96b404c53196e1a9326116f63bba06daa62223e6b25fd95d3d","observation_id":"130973af-461b-44ad-9635-7c731621ff65","resolution":{"observed_at":"2026-05-23T22:20:21.709343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:22:59.147686Z","title":"2023 , eprint=","venue":null,"work_id":"81b50bd6-b5a3-4943-9f30-19ea5bdfd626","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:1886b1de2d89d43c525ae7e23291f114e3e0c313fa81abc459012eb78f1d828f","observation_id":"e985cbda-1e97-4a7b-8112-bf29668133b1","resolution":{"observed_at":"2026-05-23T22:20:21.712716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"4cdb01d3-6d86-4e95-b7a8-7ee90b7538dc","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:257a798d38e40155dfd556940de38b7b1914213a1dce3b9defcd71a57ceaa25d","observation_id":"d5dde8f3-90df-43a0-bc4d-767f24ea125e","resolution":{"observed_at":"2026-05-23T22:20:21.716507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"81912637-504b-4970-a9a7-8b6c686e8a05","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:3e6d0fb1c9752e90381ca705d6759785421cef2fc18d712894569df1b59d6a95","observation_id":"dcd1b7e0-0f8d-4a22-80f1-8d1e31b630ec","resolution":{"observed_at":"2026-05-23T22:20:21.719656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"c87df883-aa80-4626-8d70-1c4f7f6c16ae","year":2024},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:66ee0d29f9a8047da2ccbd4f13f6c8201d6ebeddea9cbac2e0b4aa6c21b7604d","observation_id":"c97d7154-6b70-4f32-bcb3-ab6216e28512","resolution":{"observed_at":"2026-05-23T22:20:21.723153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T20:44:09.179460Z","title":"2009 , publisher=","venue":null,"work_id":"75c9142a-a015-42fa-b181-87ac5c0ba487","year":2009},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:ce70f6c2e07eb4c80079ef0799add5f66525a21e7ffb771cfb88b95e16e4414c","observation_id":"f4384be8-2529-4326-856f-7c6c2200c731","resolution":{"observed_at":"2026-05-23T22:20:21.726986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the IEEE/CVF international conference on computer vision , pages=","venue":null,"work_id":"803283ce-79ea-47db-a08b-7ae83467af2d","year":null},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:a74d241c6d12bcf47e48deff489650918858bca2c2a4e0678ccf7bab25b2f34c","observation_id":"868d901a-f915-4ae0-9030-ffb1fa32bd3b","resolution":{"observed_at":"2026-05-23T22:20:21.731508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":"997a4237-2150-4bf8-9324-194b907642f7","year":2014},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:89d7cef6b254e5153e3c4bba9ec1636cbd6e95c38e473afc563126941329d2d4","observation_id":"1a780d89-ddf8-4c5f-a88e-b4c7b7e40652","resolution":{"observed_at":"2026-05-23T22:20:21.734954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"15934baf-0962-4a76-ac3b-6e5d2aafe33c","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:115d9aea898a215aed03a27915742b59cb8e7de0d0ad78796c44f23a65518565","observation_id":"53b17f81-28c1-4ed7-9d11-dcb53d741470","resolution":{"observed_at":"2026-05-23T22:20:21.739284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"9497787e-79c9-47a0-bc73-caaad3d43f20","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:8adb7694e315a4976abe3ef48f1c1d7016e85595e0df3cefe62b9fe874da449a","observation_id":"08752f88-a987-485f-8c0d-d5ad64c66248","resolution":{"observed_at":"2026-05-23T22:20:21.742709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2022 , eprint=","venue":null,"work_id":"870457bd-0873-4fb6-a84b-0a263a218f28","year":2022},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:d2840903e01eb85c44764639015bfa5d75e1d9f7f8261ae51b47ef9176b5e168","observation_id":"85893a63-bbdf-4e22-be26-8255eba7e608","resolution":{"observed_at":"2026-05-23T22:20:21.745665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"867311c3-41f8-4824-aa22-ff98767a5bfa","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:6771a23a0504b0d7a8f5d94829aefaeb56c951ef56bfd487c745934a9e7635bb","observation_id":"5b28d85a-173f-48f6-94bd-92dfa9fadbb2","resolution":{"observed_at":"2026-05-23T22:20:21.748785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2022 , eprint=","venue":null,"work_id":"3b70b000-9218-4dc1-9f59-ca0b78eafeb4","year":2022},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:c84e3b101615648ce50c2996ebc064e63cbdb58cad5f5da809ee4cb350cb919a","observation_id":"def1f119-3f35-45eb-9521-c7fe23ebc60f","resolution":{"observed_at":"2026-05-23T22:20:21.752010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T14:46:18.205599Z","title":"2021 , eprint=","venue":null,"work_id":"52e6dbfc-97f5-4533-84f4-5802ac2d7e6d","year":2021},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:9b3870c1a9e0eb406e87ce5d52e063dbc552e6abb02bc4e0476fababa5a20108","observation_id":"50e4f4d1-5156-47d7-a703-82349913dca7","resolution":{"observed_at":"2026-05-23T22:20:21.755292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"82e7cb09-ab86-418a-9e80-106efecde008","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:09a5f1b71005757dd89a04040861ee7f9306d526b2dc35b2c6fb1671aac9fe37","observation_id":"889f30d6-66ff-46e3-a8cd-ac864de3c0a6","resolution":{"observed_at":"2026-05-23T22:20:21.758464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2022 , eprint=","venue":null,"work_id":"115f1170-e8b8-4f4c-ac24-d7cb96f0f30d","year":2022},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:0d8357952cd8e55c4c8119be0c752924bccfbdacaf31f4b75038cce0641fa168","observation_id":"1d1b284d-f935-45ae-b303-4fc392fec446","resolution":{"observed_at":"2026-05-23T22:20:21.761731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.5143773","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ilharco, M","venue":"Zenodo (CERN European Organization for Nuclear Research)","work_id":"564dbf7c-d36d-4604-a76f-f485274a2431","year":2021},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:868466e1596a663f10aa0b89c8b1e075854a35e3226ba3399477fc6fe1cb2ec5","observation_id":"b23d89ee-492c-4e7a-a013-8dba0bbd83cb","resolution":{"observed_at":"2026-05-23T22:20:21.494761Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-03T20:38:15.624002+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T20:38:15.624002+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":"2312.14238","doi":"10.48550/arxiv.2312.14238","metadata_source":"pith","pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","venue":"cs.CV","work_id":"d9e035c7-9e23-4cc2-ad3e-be080fbbf2d9","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:6181e0c42b8dee39136c9bc6585d290dd6750046f4b8da69444ad556bc856ed9","observation_id":"3c0f7ea7-d416-4146-8cf0-75fb7c87e0c3","resolution":{"observed_at":"2026-05-23T22:20:21.555822Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:56:27.721127Z","title":"Journal of machine Learning research , volume=","venue":null,"work_id":"bb6f04f5-c464-43c4-8a73-88c916a77ba2","year":null},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:cff2c37666ab383ab0527c03faf44ad89405998d956581c3313400c07a24a9e1","observation_id":"0e9966ce-37d1-44f0-93b7-2048ccca50f7","resolution":{"observed_at":"2026-05-23T22:20:21.764916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MALLET: A Machine Learning for Language Toolkit","venue":null,"work_id":"48d965bb-79e7-462f-b8cc-ce8a7a313a0e","year":null},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:02077568bd7d66b145d2b377efff135e44a77e65fc7ff2343b42990c2f281ff5","observation_id":"be2d446c-6f5f-4912-ad96-f1a291d8d32b","resolution":{"observed_at":"2026-05-23T22:20:21.768773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"27f4bf6b-8ac5-4a3a-a642-bdc02e7e8a2f","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:84bf2447eac96a38f05455f770a549d2cba76bb335e5b767761d77b7c080d083","observation_id":"10cf12b4-4978-4ef0-9fcc-fdc6bd908b85","resolution":{"observed_at":"2026-05-23T22:20:21.771895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T17:41:17.731463Z","title":"author=","venue":null,"work_id":"43bdaa01-1876-4ac1-a122-0d93833289cf","year":null},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:c5976d99c676d96442f143dc73e8f8faeceb2aabbb8a7f788647d2454158fd5f","observation_id":"32d13e77-f61a-4c37-a4a6-e532db40460c","resolution":{"observed_at":"2026-05-23T22:20:21.774842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2234.322243","doi":"10.1145/322234.322243","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chandra and Dexter C","venue":"Journal of the ACM","work_id":"c3270592-bd69-4213-95e1-4aaf8312be9b","year":1981},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:f645140cb2e0e1035d6edde57b08e4a29893efc94d44b14f2a20fb289ce9fbaa","observation_id":"7b8f70a5-b063-4cdb-aef6-48d3396a4cce","resolution":{"observed_at":"2026-05-23T22:20:21.505274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-18T08:21:12.175602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T08:21:12.175602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalable training of","venue":null,"work_id":"0bf357a4-bf12-484d-91c5-45d8c83932a5","year":2007},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:bbded9844d9968fccae9ba1144fad4138c63c089eeba42efbf34f392cb310375","observation_id":"dcac1eed-0ebb-491a-b960-166c4efa90cf","resolution":{"observed_at":"2026-05-23T22:20:21.777780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:47:52.062642Z","title":null,"venue":null,"work_id":"852d89f5-1e7b-4296-b4f2-71e578b5e9f6","year":1997},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:87d3a3be4a7d253600c430fb923bb5104e4c05c5d1cd60597718ed6b4f3dcf47","observation_id":"1ede3114-024a-4da3-927d-086b40a14301","resolution":{"observed_at":"2026-05-23T22:20:21.780927Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:47:52.089088Z","title":"Tetreault , title =","venue":null,"work_id":"75f57f43-cb6d-44a9-9cc5-9b8cfc702ea3","year":2015},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:35bf58e2a634fb6d6f9dbbf0a0d10546b7a4d0ae9360695f5f9541a3441cdbb8","observation_id":"3b1fd3fb-9745-42ea-aa2f-0e51e5f14d2e","resolution":{"observed_at":"2026-05-23T22:20:21.784256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A Framework for Learning Predictive Structures from Multiple Tasks and Unlabeled Data , Volume =","venue":null,"work_id":"84a2ed32-0a4c-4845-a075-fb640276536c","year":2005},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:91311086feaa765d313364bf9c6de0ec97b34c3f23082eb87b6ac4a3705126a1","observation_id":"1cb50b23-0e7d-42c6-9dc1-56bd9a7a53d5","resolution":{"observed_at":"2026-05-23T22:20:21.787537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Tukey, John W","venue":null,"work_id":"cc2e8405-2dab-4e00-b3b7-3020d891ee7f","year":1965},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:0bcad3046ce19850172e5d8f53b89ebcb7348f731fd4f0e790be1c8b26379f2a","observation_id":"e5e25d00-0079-4f9b-ae9e-13f995e26361","resolution":{"observed_at":"2026-05-23T22:20:21.790362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:47:52.350337Z","title":"Aho and Jeffrey D","venue":null,"work_id":"b1f5cb43-a3c7-4ea0-85e7-9ccc9dfe1588","year":1972},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:0cc62a58d34072abf7a14853c51e61c4ea5c1768d3b44ab344c27a8db0a4d0cd","observation_id":"66ed7113-b106-4834-9797-bbc5901cf189","resolution":{"observed_at":"2026-05-23T22:20:21.793548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:47:52.146752Z","title":null,"venue":null,"work_id":"aca2b566-99e0-4ebb-9c7a-a81219531259","year":1983},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:9a8259196f3d582932424b6a2d041358a574a98bff398935615bfdb4fab0f4d2","observation_id":"ee221ca3-c181-47f2-8079-9466e7e6e69e","resolution":{"observed_at":"2026-05-23T22:20:21.797329Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hewett, Jamie Huynh, Mojan Javaheripi, Xin Jin, Piero Kauffmann, Nikos Karampatziakis, Dongwoo Kim, Mahoud Khademi, Lev Kurilenko, James R","venue":null,"work_id":"b7f5f258-efe2-4334-8b42-ec75180773e8","year":2024},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:915f631b732e2c9871fd18aaa97ecc401f548b3251e73524c4f6b208d9e8a1cc","observation_id":"3817f296-48d9-494c-953d-d93ed57dcd4c","resolution":{"observed_at":"2026-05-23T22:20:21.801272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nocaps: Novel object captioning at scale","venue":null,"work_id":"0c042c59-41ae-429c-99cd-85cc277f10dc","year":2019},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:4b0702d499a199827377fffd596ecd0307f3495f8cf9c3e614017da87038116f","observation_id":"1ccf5454-28e5-461a-a525-038fe49142fb","resolution":{"observed_at":"2026-05-23T22:20:21.804481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond, 2023 a","venue":null,"work_id":"c691ea0f-c276-4546-86b1-3eb8dee35ca1","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:bbf107366d16aa3ff813f18f2c8ec3421d2631503321aaec5ee7d307c49f6f81","observation_id":"6d274f27-fba9-4712-b910-459621df9cb5","resolution":{"observed_at":"2026-05-23T22:20:21.807697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Touchstone: Evaluating vision-language models by language models, 2023 b","venue":null,"work_id":"f1d047de-f1d2-4954-8a28-4e9788798fcc","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:6e48e085c5d809885cc829448ccfe7ca7be11e8a03c0ad18be09666370bb6148","observation_id":"20ec7aa3-2814-4e87-9e78-c87026f775e7","resolution":{"observed_at":"2026-05-23T22:20:21.811178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Latent dirichlet allocation","venue":null,"work_id":"f3616fab-c5d0-47bb-9e78-80d9aa196989","year":2003},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:81edac022604774cd97336e0cc70963d98e6a31faf0651eb2eeaf8f0068bff40","observation_id":"9e0f0d3b-1789-4b9e-8e98-1e974de303a3","resolution":{"observed_at":"2026-05-23T22:20:21.814593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T06:10:44.736775Z","title":"Conceptual 12m: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":"2f0a7a0c-2783-46ea-8420-4cf5cda301f7","year":2021},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:4f7b0cea84f489949570969df9235b2d00f422b21ea644b0d393361bdf678024","observation_id":"5eb180f7-2442-4c7a-9999-de2859a1ce72","resolution":{"observed_at":"2026-05-23T22:20:21.818572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":"2311.12793","doi":"10.48550/arxiv.2311.12793","metadata_source":"pith","pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","venue":"cs.CV","work_id":"90e2b26a-3d27-4567-86b5-929b582a8034","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:81f3d1d7504e9bc3585190d97ad3d12148dc4f3e4a905a107047e74fd29da2b5","observation_id":"1356a2e4-adec-4f61-a46a-02785d6caf6b","resolution":{"observed_at":"2026-05-23T22:20:21.543720Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Phoenix: Democratizing chatgpt across languages, 2023 b","venue":null,"work_id":"4bd9fc1a-2100-4ef9-8877-f72c3f74491f","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:faacbc036dd676231000f6924a4ff482f970d030e3422d42f6abc5a620f192d9","observation_id":"12d96111-2720-40b2-9b76-e3cbc86953f5","resolution":{"observed_at":"2026-05-23T22:20:21.822026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":"0aa2a3b1-ff5f-48a1-8c2e-3e0efa840d1e","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:60c53a6520a99161cb1de07943e439214042491cfc111771465985106cd3942f","observation_id":"f88c942c-3803-4db3-ab38-982550ec80c8","resolution":{"observed_at":"2026-05-23T22:20:21.824882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mobilevlm : A fast, strong and open vision language assistant for mobile devices","venue":null,"work_id":"0130ad81-ac01-4009-b888-74b4e9e667f0","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:ef3f17a1a198b43b3d29420fa205c276d35f7184891d345a66374d2a1b23c6a9","observation_id":"ced2eb04-bf6e-4629-bf64-b210f31dadbd","resolution":{"observed_at":"2026-05-23T22:20:21.828154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"a67353e0-6103-4875-87ce-e221ba375a25","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:b8422d2ca3b8dc507fa2d4a1a37c413b1e8693e224934968083edc98f93802a4","observation_id":"62c3fc62-8603-4219-8272-b505e84d3f81","resolution":{"observed_at":"2026-05-23T22:20:21.831564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":"29b8caa6-69b1-4988-b0a5-4bd23ea25094","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:feaea06a49fbf40df6ebbb195040b676ec1f4579e1e382f9dcff7bfbceb64be5","observation_id":"6702dafa-4bf8-4cc9-b834-a48acdd1b6c4","resolution":{"observed_at":"2026-05-23T22:20:21.834696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mllm-bench, evaluating multi-modal llms using gpt-4v","venue":null,"work_id":"f33d45e4-672f-4350-b5f8-1b35cdc1e939","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:dff41d809eae6959fe091ec96a2d46562e68c6e70018c505247a06ed53055135","observation_id":"0515903f-faf0-488a-aa9e-39721797804d","resolution":{"observed_at":"2026-05-23T22:20:21.837932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hallusionbench: An advanced diagnostic suite for entangled language hallucination & visual illusion in large vision-language models","venue":null,"work_id":"eed6a8cc-aff7-4509-ad36-4289b97cbceb","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:b8accc8728bbb27050729c01b4b931b91f5eddf7e8d07c833ec7c9f95e1efcd6","observation_id":"66c33652-3752-4a31-bdee-ff5ab1ee64e4","resolution":{"observed_at":"2026-05-23T22:20:21.841508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hudson and Christopher D","venue":null,"work_id":"b6d3fa21-48bb-4d7c-a9fc-908b9b1533b5","year":2019},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:4119e7173b366ee88ec392dc010f768e3fac1ea605c57d5609d2f1ead7c550f1","observation_id":"bacb8e41-b547-4573-b237-c2c20e2998e5","resolution":{"observed_at":"2026-05-23T22:20:21.862301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing idefics: An open reproduction of state-of-the-art visual language model","venue":null,"work_id":"84b34b55-53fb-4627-962f-deaa6c4b3555","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:b00f244a98ec0a69a5aff586a3fb89dfbf50e6d8fb6954958dc937213c3b8dde","observation_id":"53b20947-e357-44ba-a96b-8a9779ef5b46","resolution":{"observed_at":"2026-05-23T22:20:21.866025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11788","last_updated":"2024-05-20T05:11:02Z","snapshot_observed_at":"2026-07-06T18:16:33.179338Z","submitted_at":"2024-05-20T05:11:02Z","title":"TinyLLaVA Factory: A Modularized Codebase for Small-scale Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2405.11788","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.11788","snapshot_observed_at":"2026-06-30T14:04:45.365675Z","title":"Tinyllava factory: A modularized codebase for small-scale large multimodal models","venue":null,"work_id":"a97eae26-6be5-4581-82fb-95982afcfcba","year":2024},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"cited_paper":"/paper/2405.11788","citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:d13906a9cdbd565b7aeb34af1ac2413ad924ac295d331c7400d18e64024f0525","observation_id":"901b63b4-68e7-4a75-9ce4-8859f4c7549d","resolution":{"observed_at":"2026-05-23T22:20:21.537698Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Shamma, Michael S","venue":null,"work_id":"5e8a9548-122f-4d6b-b664-0b38be9edcbb","year":2016},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:2e2d90a4990a4691a8ab8b3880489e11d4f7df9fb16ac8e3b9f6ec52b0ba119e","observation_id":"a981e278-73ff-494c-81c0-d73501d91d8e","resolution":{"observed_at":"2026-05-23T22:20:21.868871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension, 2023 a","venue":null,"work_id":"24d66d2b-80ae-46ad-a96c-2267dc112647","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:b138aca8bc2696c2bb9af20f3d9952ec540da721f66da8e2b848fd87c4a117f6","observation_id":"cd9df9c1-8a33-4183-950a-690d86f4bbe4","resolution":{"observed_at":"2026-05-23T22:20:21.872055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"4f7e7853-ef82-4c44-8be5-1b3034c677c4","year":2022},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:6bba32fee316ef2f1f266bc4e92ce173ae63be68c5260e3bf552b183c7f39b0d","observation_id":"26b3f7ae-e8f5-4f3e-a94c-4e7c50e5880a","resolution":{"observed_at":"2026-05-23T22:20:21.876392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models, 2023 b","venue":null,"work_id":"e6763a2f-bea8-4491-8dc1-b93dc81e9454","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:f643561ae9cf59f7020e47e3c92d7a0b3d9fec918d959eeb3d06bf7baeb5e6fe","observation_id":"319d4a34-5fb3-42cf-beb0-dfa1ba506e61","resolution":{"observed_at":"2026-05-23T22:20:21.879581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":"2312.10665","doi":"10.48550/arxiv.2312.10665","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Silkie: Preference distillation for large visual lan- guage models","venue":"arXiv (Cornell University)","work_id":"dd1b128a-36d2-47ff-a48e-98f5d1e734be","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":106,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:10539be866a6eff59dd284a3ab7f0b4e0985469c832cfd5d3047106fdf340dd7","observation_id":"2c650b40-4f4a-4d41-bb7a-cc3b06e5423c","resolution":{"observed_at":"2026-05-23T22:20:21.522610Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lawrence Zitnick, and Piotr Dollár","venue":null,"work_id":"07aabb9a-1ed0-4b6c-9308-873dfa001fb0","year":2015},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":107,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:cfb044e315ff4eac9d4817e396d4a5c080c961ff1f2f9ee7c78a676d2330056a","observation_id":"a78c0d9a-9103-471e-83d7-a84e24bb6b72","resolution":{"observed_at":"2026-05-23T22:20:21.882748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved baselines with visual instruction tuning, 2023 a","venue":null,"work_id":"744ed679-4288-4cfd-b551-f497de32bb85","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":108,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:4d20b8671ede3b8f6253d3e55d0c0702b1497cd4dd3c1ce98a8984f0953c7d63","observation_id":"71ab9a6d-b6f1-4d9d-80df-8bff52901a14","resolution":{"observed_at":"2026-05-23T22:20:21.885325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":4,"verified_exact":4,"verified_fuzzy":89},"total_outbound_references":129},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 129 outbound references and 47 inbound Pith citation observations for arXiv:2402.11684."}