{"as_of":"2026-08-18T05:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:483ba902f682a334d0309529536efdbeb9be1891dc25939369782899f540f89e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":53,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:01:39.976358Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T17:07:25.768424Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2311.07574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-07-10T17:07:25.768424Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":"cs.CV","work_id":"b73c6ce2-f994-4605-9578-597e13cb9ae7","year":2023},"citing_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-16T02:56:41.658658Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2306.13549"},"observation_digest":"sha256:ccc3a3a632fa67b05ed35771149200f786e62a3f293fedfbd137bbac67483027","observation_id":"fb08796f-a04b-43cd-99dd-3da7f1d1f638","resolution":{"observed_at":"2026-05-16T02:56:42.628229Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2311.07574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-07-10T17:07:25.768424Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":"cs.CV","work_id":"b73c6ce2-f994-4605-9578-597e13cb9ae7","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":121,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:f458cda49415b56b9cfa54d9c5725dec21ba6e8f50d67149cc5bb5267a76e334","observation_id":"246e4615-ae3c-4a41-b907-cb9847acbc77","resolution":{"observed_at":"2026-05-16T16:35:38.152397Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2311.07574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-07-10T17:07:25.768424Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":"cs.CV","work_id":"b73c6ce2-f994-4605-9578-597e13cb9ae7","year":2023},"citing_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-08-16T05:38:56.513422Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-17T05:30:27.667126Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2401.16420"},"observation_digest":"sha256:3d3a01c8d72642ef4959859eddab54942864b060690c9d53dac689d7bcd9a0c2","observation_id":"dc43a9a1-d6cd-4c80-bb6b-37ce19e8e0e5","resolution":{"observed_at":"2026-05-17T05:30:27.737221Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2311.07574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-07-10T17:07:25.768424Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":"cs.CV","work_id":"b73c6ce2-f994-4605-9578-597e13cb9ae7","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-08-09T19:28:34.281681Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:3e7fe82bde8ed043c7c517cc91de7e5d16ebc61a08088752fddea8831467e473","observation_id":"3ced92d1-13d4-4817-80a1-a4ac61a6905e","resolution":{"observed_at":"2026-05-18T15:27:52.101123Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2311.07574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-07-10T17:07:25.768424Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":"cs.CV","work_id":"b73c6ce2-f994-4605-9578-597e13cb9ae7","year":2023},"citing_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-11T17:58:54.177359Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2403.05525"},"observation_digest":"sha256:34e4ccced1ed129596df5dee451e50014c814ca92cafc46af1fd587f465067e4","observation_id":"846e3349-49b1-4036-be1c-66763a84d450","resolution":{"observed_at":"2026-05-11T17:58:54.717931Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2311.07574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-07-10T17:07:25.768424Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":"cs.CV","work_id":"b73c6ce2-f994-4605-9578-597e13cb9ae7","year":2023},"citing_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-08-16T18:14:04.403890Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-05-16T04:09:36.019146Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2403.09611"},"observation_digest":"sha256:506229059222fd3cb7b2f414fb6de62459aa17e63d60e6f478dca1be25b03552","observation_id":"41079ee0-4245-4c6d-95d0-d2ae23429ab5","resolution":{"observed_at":"2026-05-16T04:09:36.300585Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2311.07574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-07-10T17:07:25.768424Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":"cs.CV","work_id":"b73c6ce2-f994-4605-9578-597e13cb9ae7","year":2023},"citing_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-12T19:41:44.263663Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2403.20330"},"observation_digest":"sha256:68461ebf937e6e336fe43cb6fd705cb26b65c2f8a2c198d4d35a35f2c9903b67","observation_id":"91f73498-8512-43d5-b6a2-cc4d57037c79","resolution":{"observed_at":"2026-05-12T19:41:44.390189Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2311.07574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-07-10T17:07:25.768424Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":"cs.CV","work_id":"b73c6ce2-f994-4605-9578-597e13cb9ae7","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:127a98b2132c30b2f2b7a3b7b8c6251db5bd2d32b501bfd92acd1a2c976abb7b","observation_id":"e4c6ebed-d918-48a8-a469-81cab83b8464","resolution":{"observed_at":"2026-05-15T22:48:36.219428Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2311.07574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-07-10T17:07:25.768424Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":"cs.CV","work_id":"b73c6ce2-f994-4605-9578-597e13cb9ae7","year":2023},"citing_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-08-17T14:16:52.244007Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-05-12T20:58:58.849040Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2404.16821"},"observation_digest":"sha256:2b05bb63931a3f22a8047bc400ada3b3e4ab63c00fe11bd8a71f680f1f873aa2","observation_id":"bdff8938-636e-4351-b0f2-108942cf6752","resolution":{"observed_at":"2026-05-12T20:58:59.228957Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2311.07574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-07-10T17:07:25.768424Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":"cs.CV","work_id":"b73c6ce2-f994-4605-9578-597e13cb9ae7","year":2023},"citing_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-08-15T07:01:36.213052Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"reference_index":132,"source":"pdf_text","source_observed_at":"2026-05-17T00:05:03.547664Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2406.16860"},"observation_digest":"sha256:f58d16a5d194bb5a16256cbb0b7bc0a98dd67eb1cb379d95cb6a578b48bcd393","observation_id":"9be80528-7c79-4df7-a9ac-42d7cf12cd4e","resolution":{"observed_at":"2026-05-17T00:05:03.766949Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2311.07574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-07-10T17:07:25.768424Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":"cs.CV","work_id":"b73c6ce2-f994-4605-9578-597e13cb9ae7","year":2023},"citing_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-14T16:53:05.474750Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"reference_index":150,"source":"pdf_text","source_observed_at":"2026-05-17T10:46:28.447347Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2407.03320"},"observation_digest":"sha256:f31a9006dc8985ddc58753eb19970e1be0b1dbc8ceeab193cd4a46dc0174bc61","observation_id":"ec5e6333-e0bf-4e44-8a52-61b818a22b4c","resolution":{"observed_at":"2026-05-17T10:46:28.754970Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2311.07574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-07-10T17:07:25.768424Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":"cs.CV","work_id":"b73c6ce2-f994-4605-9578-597e13cb9ae7","year":2023},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:010e99c06903a3e8d07aeed1d93a9ff2076246059ff3904ed100df47cf09bf79","observation_id":"3b444aa8-0c49-43fd-906d-460b82451ffc","resolution":{"observed_at":"2026-05-15T01:55:12.693057Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-12T21:48:54.052069Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08334","last_updated":"2025-05-21T05:30:01Z","snapshot_observed_at":"2026-08-16T21:53:29.571528Z","submitted_at":"2024-11-13T04:32:58Z","title":"MIRe: Enhancing Multimodal Queries Representation via Fusion-Free Modality Interaction for Multimodal Retrieval","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T21:48:54.052069Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2411.08334"},"observation_digest":"sha256:3010ef8c2cd5b9cb750aef8744ff33334395df76ff2d40621a09bac8ba06e8a3","observation_id":"cba2aec2-877a-45a6-8f82-dbfb08cdcf5b","resolution":{"observed_at":"2026-08-12T21:48:54.052069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-12T19:33:00.999591Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10640","last_updated":"2024-11-16T00:14:51Z","snapshot_observed_at":"2026-08-17T21:54:44.695295Z","submitted_at":"2024-11-16T00:14:51Z","title":"BlueLM-V-3B: Algorithm and System Co-Design for Multimodal Large Language Models on Mobile Devices","version":1},"reference_index":124,"source":"pdf_text","source_observed_at":"2026-08-12T19:33:00.999591Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2411.10640"},"observation_digest":"sha256:4ae95fbd1bfe3493de54d0c473adfb36321b03fc2b1000468fb7d50d52c4c4c9","observation_id":"37c6eede-1eec-4593-8dac-5d4cdcd87a11","resolution":{"observed_at":"2026-08-12T19:33:00.999591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-12T05:01:00.346640Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00876","last_updated":"2025-03-21T13:30:33Z","snapshot_observed_at":"2026-08-15T10:20:00.553225Z","submitted_at":"2024-12-01T16:32:31Z","title":"Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:00.346640Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2412.00876"},"observation_digest":"sha256:1be30951543ecf787bb59a30102f6dec84ae752399a6c563c30844c7b95d8131","observation_id":"2353e9f8-d74d-4bf5-8e8e-4b59da94f0f5","resolution":{"observed_at":"2026-08-12T05:01:00.346640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-11T23:50:37.089010Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02158","last_updated":"2024-12-04T08:34:49Z","snapshot_observed_at":"2026-08-12T14:25:50.767875Z","submitted_at":"2024-12-03T04:34:23Z","title":"Agri-LLaVA: Knowledge-Infused Large Multimodal Assistant on Agricultural Pests and Diseases","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:37.089010Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2412.02158"},"observation_digest":"sha256:a05eec58251aeeef767006ae47f6702663b9b02c7b9a3040cb62a253d747a79a","observation_id":"6fb38b55-2166-4303-89fe-b62a5283848a","resolution":{"observed_at":"2026-08-11T23:50:37.089010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2311.07574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-07-10T17:07:25.768424Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":"cs.CV","work_id":"b73c6ce2-f994-4605-9578-597e13cb9ae7","year":2023},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":245,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:e6ef25fe3506b3313bc00ea57f43b7752004fa3da0f1f60985acbe5e5c67aca0","observation_id":"f63519f4-1867-4e76-b350-9d23eca62241","resolution":{"observed_at":"2026-05-10T13:23:58.101801Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-11T17:53:36.335982Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-16T23:34:44.456187Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:36.335982Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:18c5c1037b1fc988a98749fcaab8d845d585ae1e7b409a5afd0fbeb1969e6816","observation_id":"c14f66df-556f-4525-b716-5a3e9cc4b655","resolution":{"observed_at":"2026-08-11T17:53:36.335982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-11T16:58:03.454779Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09616","last_updated":"2024-12-13T04:58:33Z","snapshot_observed_at":"2026-08-14T18:32:28.081516Z","submitted_at":"2024-12-12T18:59:46Z","title":"V2PE: Improving Multimodal Long-Context Capability of Vision-Language Models with Variable Visual Position Encoding","version":2},"reference_index":120,"source":"pdf_text","source_observed_at":"2026-08-11T16:58:03.454779Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2412.09616"},"observation_digest":"sha256:7f98e7cae21cb8a491864dfc514b9559d5cbf1fefe832fb0939f7701979c2283","observation_id":"dbd852c3-0825-4781-914e-37e6b6a16722","resolution":{"observed_at":"2026-08-11T16:58:03.454779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2311.07574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-07-10T17:07:25.768424Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":"cs.CV","work_id":"b73c6ce2-f994-4605-9578-597e13cb9ae7","year":2023},"citing_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-08-17T07:24:03.168446Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-17T07:51:12.953777Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2412.14164"},"observation_digest":"sha256:6373135fce46d023e2040b3e33a1af9be2f563e1d2ae050b6abeb0fa2175b92c","observation_id":"dbefc10c-0c29-47b3-a559-8f547d0cbcfa","resolution":{"observed_at":"2026-05-17T07:51:13.416130Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2311.07574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-07-10T17:07:25.768424Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":"cs.CV","work_id":"b73c6ce2-f994-4605-9578-597e13cb9ae7","year":2023},"citing_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-15T09:15:43.841019Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-17T21:08:19.570050Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2501.01957"},"observation_digest":"sha256:b928f6c07d130c012df2e8e898550e3e5ee4816d5d559efd9c8a4372d97dc796","observation_id":"35b58c34-35a2-4dd1-8441-376a04fccdd3","resolution":{"observed_at":"2026-05-17T21:08:19.689938Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-10T22:08:09.902114Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-14T12:32:34.328935Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":258,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.902114Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:466cd9af765ef8bcf5105fd7794d5fe4985d73b6496baeff1fcb8489449269ad","observation_id":"4151c0ed-3e43-4811-8928-2af738694700","resolution":{"observed_at":"2026-08-10T22:08:09.902114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-10T15:32:55.535190Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13893","last_updated":"2025-01-23T18:08:57Z","snapshot_observed_at":"2026-08-13T23:14:19.264762Z","submitted_at":"2025-01-23T18:08:57Z","title":"Pix2Cap-COCO: Advancing Visual Comprehension via Pixel-Level Captioning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T15:32:55.535190Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2501.13893"},"observation_digest":"sha256:7c0c422b420fd7e642951f7e41c500fbc6f14724a99f512edbb2fa669e3d5c4f","observation_id":"a81bae1f-746a-4107-90b0-ebf99c150d8f","resolution":{"observed_at":"2026-08-10T15:32:55.535190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-10T18:04:34.507504Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.14818","last_updated":"2025-01-20T18:40:47Z","snapshot_observed_at":"2026-08-11T01:59:38.596539Z","submitted_at":"2025-01-20T18:40:47Z","title":"Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models","version":1},"reference_index":126,"source":"pdf_text","source_observed_at":"2026-08-10T18:04:34.507504Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2501.14818"},"observation_digest":"sha256:30a8331c96386460ce5084ac635b81225b968972ef7c6a6d3e0371517a442fcb","observation_id":"70518c8b-093a-44e4-9bac-08f2e0062082","resolution":{"observed_at":"2026-08-10T18:04:34.507504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-10T11:26:29.210443Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-17T12:17:37.264508Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.210443Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:8ec48756c1620fc4bba97594174b4efd675cd5a4dc19a652014d66ea5a14acb9","observation_id":"e5d65e6f-ce52-4940-894f-d073327309c7","resolution":{"observed_at":"2026-08-10T11:26:29.210443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-08T14:25:55.910395Z","title":"To see is to believe: Prompt- ing GPT-4V for better visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.910395Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:b1d987eeb5fb6742796424bab234ac074951126169db0f74474c5fb636d0679d","observation_id":"c6280041-f4b1-4ef6-ae4a-877331f0c2b9","resolution":{"observed_at":"2026-08-08T14:25:55.910395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2311.07574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-07-10T17:07:25.768424Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":"cs.CV","work_id":"b73c6ce2-f994-4605-9578-597e13cb9ae7","year":2023},"citing_paper":{"arxiv_id":"2504.09925","last_updated":"2026-04-29T06:12:36Z","snapshot_observed_at":"2026-08-16T10:58:08.667292Z","submitted_at":"2025-04-14T06:33:29Z","title":"FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-22T19:49:00.961388Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2504.09925"},"observation_digest":"sha256:fb89f834433a0be813d5b90253db62d7e03d1871c165193e123046070039aa9f","observation_id":"d87f0295-6e5f-4975-a7dc-91dd263cd06e","resolution":{"observed_at":"2026-05-22T19:52:01.931880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-16T11:01:39.976358Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.976358Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:f874ec4f8413c1ac85ba07e5b98d1fcfc0737a16776c3b6f92a396908093e8e7","observation_id":"8b9c1474-9b5a-4f77-9bfe-1f1c04b2e7e5","resolution":{"observed_at":"2026-08-16T11:01:39.976358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-15T22:27:46.807706Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07172","last_updated":"2025-05-12T01:51:50Z","snapshot_observed_at":"2026-08-16T21:48:09.331254Z","submitted_at":"2025-05-12T01:51:50Z","title":"Critique Before Thinking: Mitigating Hallucination through Rationale-Augmented Instruction Tuning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:46.807706Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2505.07172"},"observation_digest":"sha256:9d186b37e0a2c2d84084bdfe0887c3787385916b1309dc060c8c04310be8e7ad","observation_id":"04a819bd-1fc3-4b4d-8bc9-74b786916413","resolution":{"observed_at":"2026-08-15T22:27:46.807706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-15T21:46:32.670495Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.670495Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:41b1eba6eebb1b4fa167ec4f53dcca9a40abdf1095733af831868be86be2458e","observation_id":"e9fbeeaa-147d-48ab-8af4-d1dc59b836ec","resolution":{"observed_at":"2026-08-15T21:46:32.670495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-07T14:37:52.789583Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning.arXiv preprint arXiv:2311.07574, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-15T13:50:06.766318Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:52.789583Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:a1f78bd4c789782a7b908787a3e332801d56cfa1df924b72e4a3a2c06058368f","observation_id":"380b9a90-ab99-4a3d-8c4d-52846bee1ac0","resolution":{"observed_at":"2026-08-07T14:37:52.789583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-07T14:05:07.447847Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":136,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:07.447847Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:f02ce4b4a01d3ecb5b8b16cd823c7de0b0082129b2f526f16834a86ded280755","observation_id":"24283774-8d39-46e8-b0b9-60d9db83d88c","resolution":{"observed_at":"2026-08-07T14:05:07.447847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-07T13:53:28.020503Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning.arXiv preprint arXiv:2311.07574, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-15T07:28:43.741239Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:28.020503Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:3eb2ed64709516b9a4c5ae7736c723f5558fd008cc0a9336078775968704574e","observation_id":"00b24c17-26cc-4e54-9912-f809d9449f77","resolution":{"observed_at":"2026-08-07T13:53:28.020503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-07T12:42:26.521528Z","title":"To see is to believe: Prompting GPT-4v for better visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:26.521528Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:f1b52e01e12b094c8a00d5c4f598cff17d73e13bd5e4afdcf59f323dfc0544fe","observation_id":"1df6994e-e983-4736-9c96-d1dc5913f244","resolution":{"observed_at":"2026-08-07T12:42:26.521528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-07T13:20:33.198713Z","title":"arXiv preprint arXiv:2311.07574 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23830","last_updated":"2025-05-28T08:38:39Z","snapshot_observed_at":"2026-08-17T18:11:33.461839Z","submitted_at":"2025-05-28T08:38:39Z","title":"EvoMoE: Expert Evolution in Mixture of Experts for Multimodal Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:33.198713Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2505.23830"},"observation_digest":"sha256:5e9d2bbb329db1f2fd7aaa2176c69301f8b9a268abbfe7abaac713e3eeddd3c0","observation_id":"aa307276-50eb-488a-b3c3-61cad5c90d37","resolution":{"observed_at":"2026-08-07T13:20:33.198713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-07T12:02:10.642601Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00806","last_updated":"2025-06-01T03:15:29Z","snapshot_observed_at":"2026-08-09T07:52:39.727951Z","submitted_at":"2025-06-01T03:15:29Z","title":"Fast or Slow? Integrating Fast Intuition and Deliberate Thinking for Enhancing Visual Question Answering","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T12:02:10.642601Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2506.00806"},"observation_digest":"sha256:74bf020f4ae5dfb00937928831d9e108307075458ca0b0daee9c1c5a2f89c619","observation_id":"773e5efe-48b2-4f08-824e-8193d0d72480","resolution":{"observed_at":"2026-08-07T12:02:10.642601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-07T06:07:18.730814Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06406","last_updated":"2025-06-25T12:36:55Z","snapshot_observed_at":"2026-08-16T10:03:11.871268Z","submitted_at":"2025-06-06T12:47:29Z","title":"SMAR: Soft Modality-Aware Routing Strategy for MoE-based Multimodal Large Language Models Preserving Language Capabilities","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:18.730814Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2506.06406"},"observation_digest":"sha256:19dba8d4c897d3688b8c5eac74d6c6f09c9019aeb3d13fc189b6a39965683d7c","observation_id":"464049c1-2cff-40ee-a310-a8cab0779050","resolution":{"observed_at":"2026-08-07T06:07:18.730814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-07T04:34:08.755303Z","title":"To see is to believe: Prompting GPT-4V for better visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:08.755303Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:a2930e2cc7479f68db79ddc051e7392c97355849c62194583970e11b561cd008","observation_id":"7d658a2d-493f-4c3d-8b4e-c7ef1a5e2a14","resolution":{"observed_at":"2026-08-07T04:34:08.755303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-06T18:24:53.783559Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-17T04:35:04.850485Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:53.783559Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:0c86e659d12f797a70459680fe90ce7f24c96605f920ea64e4c3849bed25709d","observation_id":"0e37eb4b-4166-45b0-b6df-e75df5fd21a9","resolution":{"observed_at":"2026-08-06T18:24:53.783559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-06T16:50:05.174737Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-16T04:56:37.330824Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:05.174737Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:c2f4b38317ec1d314d4260ae39be50663b3fd69821cc8eb604ed2a2ef55d3186","observation_id":"b970ecbc-9311-4a1b-bd3c-f83feadd74b4","resolution":{"observed_at":"2026-08-06T16:50:05.174737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-06T12:12:23.689342Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22003","last_updated":"2025-07-30T04:41:52Z","snapshot_observed_at":"2026-08-13T17:40:27.042540Z","submitted_at":"2025-07-29T16:53:27Z","title":"See Different, Think Better: Visual Variations Mitigating Hallucinations in LVLMs","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T12:12:23.689342Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2507.22003"},"observation_digest":"sha256:a233902556db5d5375340bf3ee3bb3eb22cf6ad24a355361a1fd67938a8a2468","observation_id":"95153f93-0b08-4be7-a40f-5c9f3ef25d0c","resolution":{"observed_at":"2026-08-06T12:12:23.689342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-05T22:35:18.637019Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06814","last_updated":"2025-08-09T04:22:30Z","snapshot_observed_at":"2026-08-15T14:52:15.606685Z","submitted_at":"2025-08-09T04:22:30Z","title":"Metadata Management for AI-Augmented Data Workflows","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:18.637019Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2508.06814"},"observation_digest":"sha256:b9a131e37aa5aecdc632eeb6af54c50639032294815d0cf2172b751a3382cb6d","observation_id":"28cd8b76-9dd8-4a98-94ff-bdf1db514fcc","resolution":{"observed_at":"2026-08-05T22:35:18.637019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-05T14:03:38.489435Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21767","last_updated":"2025-08-29T16:40:57Z","snapshot_observed_at":"2026-08-13T07:42:36.869987Z","submitted_at":"2025-08-29T16:40:57Z","title":"UItron: Foundational GUI Agent with Advanced Perception and Planning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:38.489435Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2508.21767"},"observation_digest":"sha256:6df910a33765f83ba6a7fd88018c263f0e1be04c63130757627983f19ae86db1","observation_id":"a8d5f0d5-a4b0-4106-a68a-5824764c9cde","resolution":{"observed_at":"2026-08-05T14:03:38.489435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-05T12:27:27.502470Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-17T12:03:39.901876Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.502470Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:002116e899bc83effb2be77976c64d34156cead626d158ab49dd4bda2bf69bae","observation_id":"97f328e9-a648-4b06-ba86-243fe4c8799c","resolution":{"observed_at":"2026-08-05T12:27:27.502470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-03T04:20:57.669229Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning.arXiv preprint arXiv:2311.07574, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:57.669229Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:2c9f9f207adc92a8446d66b618261cc9f959b54657ddd502927be81ebd7e8466","observation_id":"260f681b-8edd-4671-8ead-82b65f1cc844","resolution":{"observed_at":"2026-08-03T04:20:57.669229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2311.07574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-07-10T17:07:25.768424Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":"cs.CV","work_id":"b73c6ce2-f994-4605-9578-597e13cb9ae7","year":2023},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-08-16T03:45:19.381242Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:f94fc87b534d7c539621e122b144b21acbff9d8e2ea5caadd9c73c7e52a28e26","observation_id":"5ce4d7eb-816a-44b9-acb1-7698013bf443","resolution":{"observed_at":"2026-05-11T03:50:56.484333Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2311.07574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-07-10T17:07:25.768424Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":"cs.CV","work_id":"b73c6ce2-f994-4605-9578-597e13cb9ae7","year":2023},"citing_paper":{"arxiv_id":"2606.21734","last_updated":"2026-06-19T20:43:49Z","snapshot_observed_at":"2026-08-05T18:05:51.515234Z","submitted_at":"2026-06-19T20:43:49Z","title":"HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning","version":1},"reference_index":264,"source":"arxiv_source","source_observed_at":"2026-06-26T14:19:53.450263Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2606.21734"},"observation_digest":"sha256:16a99473bc62ae1331a4b3a01d5f04f2fb00fbfaf2b6313bff019256a480e433","observation_id":"0174631a-5b6f-4a47-8001-62f592d94ac9","resolution":{"observed_at":"2026-07-04T06:39:37.498843Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2311.07574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-07-10T17:07:25.768424Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":"cs.CV","work_id":"b73c6ce2-f994-4605-9578-597e13cb9ae7","year":2023},"citing_paper":{"arxiv_id":"2606.28551","last_updated":"2026-08-10T01:17:41Z","snapshot_observed_at":"2026-08-13T23:28:37.542175Z","submitted_at":"2026-06-26T19:11:29Z","title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","version":1},"reference_index":295,"source":"pdf_text","source_observed_at":"2026-06-30T01:16:16.834861Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2606.28551"},"observation_digest":"sha256:748fabc152409afad5ffc8aa4807857fd6c450ee8c339788fcde65bab275cdd4","observation_id":"2de9cc4a-c6b4-43ab-92a2-701dbd88eb47","resolution":{"observed_at":"2026-07-01T15:45:47.669670Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2311.07574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-07-10T17:07:25.768424Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":"cs.CV","work_id":"b73c6ce2-f994-4605-9578-597e13cb9ae7","year":2023},"citing_paper":{"arxiv_id":"2606.28551","last_updated":"2026-08-10T01:17:41Z","snapshot_observed_at":"2026-08-13T23:28:37.542175Z","submitted_at":"2026-06-26T19:11:29Z","title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","version":2},"reference_index":295,"source":"pdf_text","source_observed_at":"2026-07-02T21:10:10.548489Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2606.28551"},"observation_digest":"sha256:318a1a16469692e0478dbe2c0b25e5b13102e09903077f0c5ca36c21deb632aa","observation_id":"3bc2e407-a963-4718-b5a0-7862c86e6e55","resolution":{"observed_at":"2026-07-02T21:17:24.034330Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2311.07574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-07-10T17:07:25.768424Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":"cs.CV","work_id":"b73c6ce2-f994-4605-9578-597e13cb9ae7","year":2023},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-10T17:02:28.089092Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:f448557537c84c3d76019ba85ca67707ce89eae53b2fcabf6b88bcdb9ec43cca","observation_id":"31f9f1ea-8638-4cf0-88e6-79b6c128692d","resolution":{"observed_at":"2026-07-10T17:07:25.769682Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-02T08:03:52.315630Z","title":"To see is to believe: Prompting GPT-4V for better visual instruction tuning.arXiv preprint arXiv:2311.07574, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:52.315630Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:925e18b2a110041a2347bfdfae00b59aae2a580b26fadafb581dbff336ab3d21","observation_id":"011eca1f-ffd9-45a6-a8a8-4b041fdf3c3c","resolution":{"observed_at":"2026-08-02T08:03:52.315630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-01T04:30:11.620048Z","title":"arXiv preprint arXiv:2311.07574 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22531","last_updated":"2026-07-24T17:59:39Z","snapshot_observed_at":"2026-08-14T14:09:07.258818Z","submitted_at":"2026-07-24T17:59:39Z","title":"Twins: Learn to Predict Unified Representations with Focal Loss","version":1},"reference_index":281,"source":"arxiv_source","source_observed_at":"2026-08-01T04:30:11.620048Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2607.22531"},"observation_digest":"sha256:ab9bc6a06b99539f30d3d57d7f8faddcfab5e0f3b419b317f2b8c21414531207","observation_id":"cb964605-00b7-4897-b627-d49e8787f565","resolution":{"observed_at":"2026-08-01T04:30:11.620048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-15T14:28:03.481999Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning.arXiv preprint arXiv:2311.07574, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.481999Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:697d7e330805d182baa5fa110b57acadfc0ef18f691b2eb538fcdbaa26cd63c5","observation_id":"39244b89-6a3e-4823-8faa-1fa97e178d37","resolution":{"observed_at":"2026-08-15T14:28:03.481999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2311.07574/citation-record","integrity":"/paper/2311.07574/integrity","json":"/paper/2311.07574/citation-record.json","paper":"/paper/2311.07574"},"outbound":[],"paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 53 inbound Pith citation observations for arXiv:2311.07574."}